- RAID sistemos pagerina našumą ir prieinamumą, tačiau jos nepakeičia atsarginių kopijų ir nėra apsaugotos nuo fizinių, loginių ar žmonių sukeltų gedimų.
- Keisti garsai, suprastėjusi būsena, neįprastas lėtumas ir lyginumo arba skaitymo / rašymo klaidos yra aiškūs gresiančių RAID problemų požymiai.
- Priverstinis perkūrimas, diskų pertvarkymas be dokumentacijos arba bendrų taisymo įrankių naudojimas gali paversti valdomą gedimą visišku duomenų praradimu.
- Apdairus ir ankstyvas veiksmas kartu su RAID atkūrimo specialistų pagalba labai padidina informacijos išsaugojimo galimybes.
RAID sistemos tapo įprastos serveriuose, NAS įrenginiuose ir duomenų saugojimo masyvuose, nes jos žada didesnį našumą ir atsparumą gedimams . Tačiau, nors jos ir suteikia ramybę, jos nėra stebuklinga priemonė: prastai valdomas gedimas gali sukelti katastrofą ir per kelias minutes palikti jus be duomenų.
Kai RAID sistema pradeda rodyti neįprastus simptomus, svarbiausia ne kuo greičiau imtis taisymo veiksmų, o būti atsargesniam. Gedimo požymių nustatymas ir žinojimas, ko NEdaryti, lemia skirtumą tarp paprasto disko pakeitimo ir visiško ir neatkuriamo duomenų praradimo, net ir profesionaliai laboratorijai.
Kas yra RAID gedimas ir kodėl jis nėra tas pats, kas atsarginė kopija?
RAID (perteklinis nepriklausomų diskų masyvas) sugrupuoja kelis diskus, kad būtų užtikrintas didesnis prieinamumas, našumas ir (arba) perteklius , priklausomai nuo naudojamo lygio. Nuo klasikinio veidrodinio RAID 1 iki sudėtingesnių konfigūracijų, tokių kaip RAID 5, RAID 6 arba RAID 10, idėja yra ta, kad sistema toliau veikia net ir sugedus vienam (ar keliems) fiziniams diskams.
Problema ta, kad daugelis žmonių mano: „Turiu RAID, vadinasi, turiu atsarginę kopiją“, ir tai yra esminė klaida. RAID nepakeičia atsarginių kopijų : jis apsaugo nuo vieno ar kelių diskų gedimų (priklausomai nuo RAID lygio), tačiau neapsaugo nuo loginių iškraipymų, žmogiškųjų klaidų, išpirkos reikalaujančių programų, atsitiktinio ištrynimo ar valdiklio ar serverio gedimų.
Be to, tai, kaip valdiklis , įskaitant valdiklio programinę-aparatinę įrangą , paskirsto duomenis (disko tvarka, juostelių dydis, lyginumo algoritmai, metaduomenys ir kt.), reiškia, kad bet koks neteisingas masyvo manipuliavimas gali sugadinti struktūrą ir labai apsunkinti atkūrimą, net kai diskai „atrodo“ tvarkingi.
Pagrindiniai RAID lygiai ir jų įtaka atkūrimui
Kiekvienas RAID lygis gedimų atveju elgiasi skirtingai, ir tai daro didelę įtaką duomenų atkūrimo galimybėms. Šių skirtumų supratimas padeda išvengti rizikingų sprendimų, kai kas nors nutinka ne taip.
RAID 0 masyve duomenys yra paskirstomi keliuose diskuose be lyginumo ar veidrodinio atspindžio. Nėra jokio perteklinio duomenų perdavimo : jei vienas diskas sugenda arba pakankamai susilpnėja, loginis praradimas yra visiškas, nes trūksta esminės kiekvieno failo dalies. Kalbėti apie „rekonstrukciją“ čia neturi prasmės; prioritetas yra bandyti atkurti tai, ką galima atkurti iš fiziškai pažeistų diskų.
RAID 1 masyve diskai yra veidrodiniai: kiekviename diske yra visa duomenų kopija . Ši konfigūracija paprastai yra gana patikima duomenų atkūrimui, jei nedaroma jokių tvarkymo klaidų (pavyzdžiui, vieno iš diskų inicijavimas kitoje sistemoje arba jų maišymas nesuderinamuose valdikliuose).
RAID 5 paskirsto duomenis keliuose diskuose ir apskaičiuoja paskirstytą lyginumą, todėl gali atlaikyti vieno disko gedimą . Problema kyla, kai perkūrimo metu pradeda veikti netinkamai antras diskas: darbo krūvis staiga padidėja, atsiranda skaitymo klaidų ir masyvas gali sugesti be įspėjimo.
RAID 6 veikia panašiai kaip RAID 5, tačiau prideda antrą lyginumą, leidžiantį toleruoti iki dviejų diskų gedimus . Dėl to architektūra yra sudėtingesnė, atkūrimas užtrunka ilgiau, o bet kokios loginės ar konfigūracijos klaidos dar labiau apsunkina atkūrimo pastangas.
RAID 10 sujungia veidrodžius ir juosteles: veidrodinės diskų poros yra „subraižomos“. Atkūrimo tikslais labai svarbi diskų tvarka ir santykis tarp veidrodžių ir juostelių ; pozicijų maišymas arba aklas perkūrimas gali sugadinti masyvą, net jei visi diskai fiziškai sveiki.
Aiškūs požymiai, kad jūsų RAID pradeda gesti
Prieš visiškai sugeddama sistema, ji paprastai palieka keletą užuominų. Išmokus jas atpažinti, galima laiku sustabdyti žalą ir išvengti tolesnės žalos.
Vienas akivaizdžiausių požymių yra keisti garsai, sklindantys iš diskų: pasikartojantys spragsėjimai, girgždėjimas, protarpinis zvimbimas arba metaliniai garsai, kurių anksčiau nebuvo. Šie garsai paprastai rodo mechaninius skaitymo / rašymo galvučių ar plokštelių gedimus arba variklio problemas. Jei juos ignoruosite ir toliau skaitysite, disko būklė paprastai labai greitai pablogės.
Kitas tipiškas požymis yra pranešimų „Degraded“ (liet. Sugedusi), „Failed“ (liet. Nepavyko) arba „Critical“ (liet. Kritinė) pasirodymas NAS arba RAID valdiklio valdymo konsolėje. Šis pranešimas reiškia, kad vienas ar keli diskai pažymėti kaip problemiški ir masyvas veikia be numatyto perteklinio duomenų kiekio. Šiuo atveju, ypač naudojant RAID 5, antras gedimas gali būti paskutinis lašas.
Atkreipkite dėmesį į mažiau pastebimus, bet ne mažiau pavojingus simptomus, tokius kaip staigus ir nepaaiškinamas našumo sumažėjimas . Jei skaitymo ir rašymo laikas staiga padidėja, ypač bandant pasiekti tam tikrus tomus ar aplankus, valdiklis gali susidurti su sunkiai skaitomais sektoriais arba nuolat kartoti duomenis, kurie perkrauna sistemą.
Sistemos arba valdiklio žurnaluose dažnai rodomos įvesties / išvesties klaidos, neteisingi lyginumo pranešimai, „Nepataisoma skaitymo klaida“, „Lyginumo patikrinimas nepavyko“ arba „Aptikta bloga juostelė“. Nuolatinis skaitymo / rašymo klaidų skaičiaus padidėjimas , net jei sistema vis dar veikia, yra raudona vėliavėlė, kurios nereikėtų ignoruoti.
Kitas įspėjamasis ženklas yra tas, kad tomas atrodo sugedęs, nors, regis, nė vienas diskas nėra visiškai sugedęs . Tai paprastai rodo loginį RAID metaduomenų arba paskirstytų blokų sugadinimą, o automatinio atkūrimo priverstinis atlikimas šioje būsenoje gali išplatinti sugadinimą visame masyve.
Loginio sugadinimo ir tyliųjų RAID problemų simptomai
Ne visi RAID gedimai akimirksniu „miršta“ disko. Dažnai problema yra laipsniškas duomenų sugadinimas , kuris tyliai sėlina, kol situaciją tampa labai sunku ištaisyti.
Tipiškas pavyzdys yra failai, kurie atrodo esantys, yra tinkamo dydžio ir pavadinimo, bet neatsidaro, turi formatavimo klaidų arba yra sutrumpinti . Duomenų bazės, kurios neprisijungia, virtualios mašinos, kurios nepaleidžiamos, arba vaizdai, kuriuos peržiūros programa atmeta, paprastai rodo blokų, paskirstytų po diskus, neatitikimus.
Taip pat įprasta, kad operacinė sistema arba programos tam tikruose RAID tomuose rodo lokalų sulėtėjimą, net jei procesorius ir RAM neatrodo ypač apkrauti. Jei sulėtėjimas sutelktas skaitymo / rašymo operacijose tame pačiame tome, labai tikėtina, kad susiduriate su duomenų sugadinimu arba nestabiliais sektoriais.
Kitas pavojingas simptomas yra tas, kad po disko pakeitimo prasidedantys atkūrimai visada sustoja toje pačioje vietoje , pateikia keistų klaidų arba tiesiog pažymi procesą kaip nepavykusį. Tai paprastai rodo, kad šaltinio blokai jau yra sugadinti ir valdiklis negali sugeneruoti nuoseklios kopijos naujame diske.
Kartais SMART įspėjimai rodomi tik viename diske (perskirstyti sektoriai, didelis prieigos laikas ir pan.), tačiau neįprastas elgesys pastebimas visame RAID masyve. Tokiais atvejais vienas diskas su blogais sektoriais gali pakenkti viso masyvo nuoseklumui, ypač kai pradedamas lyginumo patikrinimas arba atkūrimas.
Ignoruojant šiuos įspėjimus ir tęsiant įprastą veikimą arba, dar blogiau, priverčiant atlikti intensyvias užduotis, pvz., patikrinimus, masines atsargines kopijas ar automatinį atkūrimą, gali išplisti duomenų korupcija ir perrašyti galiojančius blokus pažeistais duomenimis . Nuo to momento net profesionalūs įrankiai negali garantuoti visiško atkūrimo.
Tipiniai valdiklių, serverių ir pagrindinių plokščių gedimai
Ne viskas susiję su diskais. RAID valdiklis, pagrindinė plokštė ar net visas serveris gali tapti silpnąja grandinės grandimi ir sukelti masyvo gedimus, net jei diskai yra sveiki.
RAID valdiklis, nesvarbu, ar tai būtų speciali aparatinė įranga, ar integruotas į pagrindinę plokštę, yra atsakingas už tai, kur kiekvienas blokas bus įrašytas, kaip bus apskaičiuotas paritetas ir kaip bus surinkti tomai . Gedimas, sugadinta programinė įranga arba įtampos šuolis gali jį išjungti, todėl masyvas dings arba bus rodomas kaip „Svetimas“, „Neprisijungęs“ ar panašiai.
Kalbant apie specialius aparatinės įrangos valdiklius, iškyla papildoma problema: beveik visiškas modelių ir gamintojų suderinamumo trūkumas . Pavyzdžiui, sugedus konkrečiam „Supermicro“ valdikliui, nepakanka jį tiesiog pakeisti „panašiu“: dažnai tam, kad jis teisingai nuskaitytų RAID metaduomenis, reikia to paties modelio su panašia programinės įrangos versija.
Naudojant integruotus RAID sprendimus (vadinamuosius „netikrus RAID“), tokius kaip kai kurie AMD arba „Intel“ lustų rinkinių programinės įrangos RAID, kyla rizika, kad pakeitus pagrindinę plokštę, iš naujo nustačius BIOS arba praradus CMOS konfigūraciją, masyvas gali tapti neveikiantis. Daugelyje stalinių kompiuterių ir darbo stočių pagrindinės plokštės arba CMOS baterijos gedimas gali sunaikinti RAID konfigūraciją, o diskai lieka izoliuotais įrenginiais.
Be to, pats serveris ( maitinimo šaltinis , atmintis, pagrindinė plokštė, galinė plokštė ir kt.) gali sugesti dėl elektros problemų, perkaitimo ar aparatinės įrangos defektų. Daugeliu šių atvejų praktinis rezultatas yra tas, kad RAID tampa nepasiekiamas , nors iš tikrųjų diskai, prijungti prie kitos sistemos naudojant atitinkamą strategiją, galėtų atkurti savo duomenis.
Dar blogiau, sistema turi „iš naujo surinkti“ RAID masyvą kiekvieną kartą paleidus iš naujo arba įkraunant kompiuterį. Jei šio proceso metu nutrūksta maitinimas, padidėja įtampa arba įvyksta klaidos konfigūracijos failuose (pvz., „mdadm.conf“ sistemoje „Linux“), sistema gali neteisingai surinkti masyvą, palikti jį nepilną arba tiesiog jo neatpažinti, todėl tomas tampa nebenaudojamas.
Dažniausios duomenų praradimo RAID masyvuose priežastys
Atsižvelgiant į visa tai, kas išdėstyta pirmiau, akivaizdu, kad RAID masyvai, nors ir labai naudingi, vis tiek susiduria su nemaža rizika. Pagrindinės tikrosios duomenų praradimo priežastys šiose aplinkose paprastai yra fizinių, loginių ir žmogiškųjų veiksnių derinys.
Akivaizdžiausia priežastis yra vieno ar kelių diskų gedimas dėl nusidėvėjimo, gamybos defektų, vibracijos, temperatūros ar smūgių. Nors RAID yra sukurtas taip, kad atlaikytų kai kurias iš šių situacijų, jis ne visada pavyksta be šalutinės žalos : diskas, kuris pradeda grąžinti sugadintus sektorius, gali sugadinti kaimyninį diską, ypač tikrinimo ar atkūrimo procesų metu.
Kitas dažnas problemų šaltinis yra surinkimo arba rekonstrukcijos klaidos . Jei sistema prijungia masyvą su neteisingais parametrais, diskais netinkama tvarka, RAID lygiai skiriasi nuo originalių arba po nepavykusio perkėlimo, duomenys gali lengvai susikirsti. Praktiškai tomas gali būti rodomas kaip RAW, jį gali reikėti formatuoti arba jame gali būti rodomos nenuoseklios failų struktūros.
Serverio gedimai (pagrindinė plokštė, programinė-aparatinė įranga, pagrindinė plokštė, SAS/SATA valdiklis ir kt.) taip pat vaidina svarbų vaidmenį. Labai dažnai incidentų atveju, kai serveris staiga sugenda, RAID masyvas tampa neprieinamas ir sistema nemato duomenų , net jei jie fiziškai vis dar yra diskuose.
Prie viso to turime pridėti žmogiškuosius veiksnius: konfigūracijos pakeitimus be dokumentacijos, diskų pertvarkymą „bandymui“, BIOS atnaujinimus be ankstesnės konfigūracijos atsarginės kopijos, netyčinį tomų ištrynimą, operacinės sistemos diegimą iš naujo diskuose, kurie buvo masyvo dalis, arba sugadintų ar nepilnų atsarginių kopijų atkūrimą tame pačiame pažeistame RAID diske.
Galiausiai, yra išorinių grėsmių, tokių kaip išpirkos reikalaujanti programinė įranga, kuri gali užšifruoti ir duomenis, ir RAID masyvuose esančių tomų struktūras . Tokiais atvejais atkūrimo procesas tampa dvigubai sudėtingesnis: pirmiausia reikia išspręsti šifravimo problemą, o tada – galimą paties RAID vidinį sugadinimą.
Ko NEdaryti, kai RAID pradeda gesti
Kai savaitgalį sugenda serveris ir visi įsitempę, dažniausia reakcija yra ta, kad kažkas bando jį nedelsiant sutaisyti. Tai suprantama, tačiau daugelis šių geranoriškų pastangų yra būtent tai, kas galiausiai pablogina duomenų kokybę.
Pavojingiausia pagunda yra priverstinai atlikti automatinį atkūrimą pirmiausia neišanalizavus tikrosios diskų būklės . Jei viename iš diskų yra sugadintų duomenų arba neįskaitomų sektorių, atkūrimo metu bus nukopijuoti ir sumaišyti nereikalingi duomenys su tinkamais duomenimis, kol tomo struktūra bus visiškai sunaikinta.
Kita dažna klaida – atsitiktinis diskų keitimas nežinant, kuris iš jų iš tikrųjų sugadintas, arba nedokumentuojant kiekvieno disko pradinės padėties . Diskų perkėlimas tarp skyrių, jų maišymas skirtinguose valdikliuose arba kelių keitimas vienu metu be plano gali supainioti valdiklį ir RAID masyvas prarasti savo konfigūracijos stebėjimą.
Paleisti tokias priemones kaip CHKDSK sistemoje „Windows“ arba fsck sistemoje „Linux“ tiesiogiai RAID tome, kuriame yra sugadinimo požymių, taip pat yra labai rizikinga. Šios programos bando „pataisyti“ failų struktūrą pagal lenteles, kurios gali būti pažeistos , o jų taisymai dažnai apima įrašų ištrynimą, blokų perkėlimą ir metaduomenų perrašymą. Jau ir taip pažeistoje aplinkoje tai gali lemti tūkstančių failų praradimą visam laikui.
Lygiai taip pat blogai yra pasikliauti bendra RAID atkūrimo programine įranga, kuri žada „automatiškai nustatyti bet kokį RAID “. Daugelis šių įrankių veikia paviršutiniškai, darydami prielaidą apie standartinius juostų, poslinkio ir lyginumo modelius, kurie ne visada yra taikomi. Netinkamas naudojimas gali perrašyti pagrindinius sektorius arba palikti diskus blogesnės būklės nei tada, kai jie buvo pirmą kartą įdiegti.
Galiausiai, pakartotinis serverio paleidimas iš naujo, NAS įjungimas ir išjungimas arba tolesnis įprastas darbas su sugedusiu RAID masyvu arba tokiu, kuriame yra pariteto klaidų, tik dar labiau pažeidžia diskus, perskirsto daugiau sektorių ir platina gedimus . Kuo daugiau įrašų atliekama po pirmosios rimtos problemos, tuo mažiau erdvės turės specialistai.
Atsargumo priemonės, kurių reikia imtis aptikus galimą RAID gedimą
Susidūrus su bet kokiais rimtais simptomais (triukšmu, sumažėjusia būsena, pariteto klaidomis, dideliu sulėtėjimu, nepavykusiais atkūrimais ir pan.), išmintingiausia būtų sulėtinti tempą ir tęsti metodiškai . Ko nerašote ar nepakeisite dabar, gali būti galima išgelbėti vėliau.
Pirmiausia reikia nedelsiant sustabdyti bet kokias rašymo operacijas masyve : nekopijuoti duomenų, nekurti naujų virtualių mašinų, nedaryti masinių atnaujinimų. Jei tomas vis dar pasiekiamas, geriausia jį prijungti kaip skirtą tik skaitymui, jei sistema tai leidžia.
Toliau patartina kuo išsamiau dokumentuoti dabartinę būseną: BIOS arba NAS sąsajos ekrano kopijas, diskų sąrašą su jų fizine vieta, serijos numeriu, prievadais, prie kurių jie prijungti, tikslius klaidų pranešimus, rodomus žurnaluose, ir kt. Ši informacija yra neįkainojama bet kuriai atkūrimo laboratorijai, atkuriant pradinį scenarijų.
Tais atvejais, kai RAID nepavyksta prijungti arba serveris neįsikrauna, vienas iš techninių variantų yra išimti diskus ir prijungti juos prie kito kompiuterio, kad būtų sukurtos kiekvieno disko kopijos pagal sektorius . Šios kopijos, sukurtos tik skaitymui, leidžia vėliau dirbti su klonais nepažeidžiant originalių diskų.
Turint pažangių žinių, specializuotus įrankius ir kontroliuojamą aplinką, iš šių klonų galima bandyti logiškai rekonstruoti masyvą, nustatant disko eiliškumą, juostelių dydį, lyginumo modelius, poslinkius ir metaduomenis . Tačiau tai yra subtili atvirkštinės inžinerijos užduotis: bet koks bandymas ir klaida, susijusi su atsitiktiniais parametrų pakeitimais, gali lemti klaidingą duomenų interpretavimą.
Daugumai įmonių ir kritinių aplinkų saugiausias veiksmų planas yra kuo greičiau susisiekti su profesionalia RAID atkūrimo tarnyba ir vykdyti jų pradinius nurodymus. Sėkmės rodiklis paprastai yra glaudžiai susijęs su nepavykusių bandymų, atliktų prieš pasiekiant laboratoriją, skaičiumi.
Kaip veikia profesionalios RAID atkūrimo laboratorijos
Profesionalios duomenų atkūrimo paslaugos, kurios specializuojasi RAID aplinkose, derina išsamias žinias apie aparatinę įrangą ir failų sistemas su patentuotais įrankiais ir griežtomis procedūromis. Paprastai taip jos ir daro, gavusios gedimo RAID atvejį.
Pirmas žingsnis – atlikti individualią kiekvieno standžiojo disko diagnostiką : patikrinama mechaninė, elektroninė ir loginė diskų būklė, nustatomi blogi sektoriai, peržiūrimos SMART lentelės ir įvertinama trumpalaikio gedimo rizika. Jei kurie nors diskai yra fiziškai pažeisti, pirmenybė teikiama jų apdorojimui švarioje patalpoje.
Toliau iš visų susijusių diskų sukuriami teismo ekspertizės klonai . Užuot dirbus su originalais, sukuriama kopija sektorius po sektoriaus, naudojant įrankius, leidžiančius praleisti smarkiai pažeistus sektorius arba bandyti dar kartą naudojant saugius šablonus. Tikslas – išsaugoti pradinę būseną tuo atveju, jei prireiktų grįžti prie ankstesnio proceso etapo.
Paruošus klonus, atliekamas rankinis loginis RAID rekonstravimas : nustatomas lygis (0, 1, 5, 6, 10 ir kt.), disko tvarka, juostelių dydis, poslinkiai, lyginumo algoritmai ir visos kitos originalaus valdiklio charakteristikos. Dažnai tomą galima rekonstruoti net neturint to paties valdiklio ar NAS, kuris jį sukūrė.
Kai rekonstruotas virtualus tomas atrodo vientisas, failų sistema prireikus taisoma : NTFS, ReFS, ext4, XFS, Btrfs, ZFS, VMFS ir kt. Šis darbas panašus į chirurgo darbą: koreguojamos struktūros, perkuriamos inodų lentelės, MFT, superblokai arba žurnalai, visada stengiantis pakeisti kuo mažiau.
Galiausiai duomenys yra išgaunami ir sistemingai patvirtinami. Patikrinama pagrindinių duomenų bazių, virtualių mašinų ir svarbių aplankų vientisumas, patikrinama, ar failai atsidaro teisingai, o duomenys pateikiami naujose, izoliuotose laikmenose , tokiose kaip išoriniai standieji diskai arba naujas NAS, kad klientas galėtų peržiūrėti atkūrimą prieš jį patvirtindamas.
Ypač sudėtinguose scenarijuose, tokiuose kaip išpirkos reikalaujančių programų paveikti RAID, nepavykę ankstesni atkūrimai arba virtualūs tomai jau pažeistuose masyvuose, iššifravimo metodai, teismo ekspertizė ir RAID atkūrimas yra derinami, tačiau visada laikantis tos pačios taisyklės: nelieskite originalų daugiau nei būtina.
Galiausiai, RAID sistemos yra galingas įrankis duomenų prieinamumui gerinti, tačiau jos išlieka pažeidžiamos fizinių, loginių ir žmogiškųjų klaidų. Jų silpnųjų vietų supratimas, ankstyvųjų įspėjamųjų ženklų nustatymas ir, svarbiausia, impulsyvių sprendimų vengimas gedimo atveju yra tai, kas iš tikrųjų lemia skirtumą tarp nedidelės baimės ir duomenų katastrofos.
