- RAID kļūmes gadījumā nekavējoties jāpārtrauc visa rakstīšana, lai novērstu neatgriezeniskus bojājumus.
- Loģiska rekonstrukcija drošā vidē un no kloniem ir galvenais datu atgūšanas elements.
- Cilvēciskās kļūdas (piespiedu atjaunošana, nepareiza disku maiņa) ir visbīstamākais cēlonis.
- Labu dublējumu apvienošana ar profesionāliem pakalpojumiem palielina panākumu iespējamību.

Kas ir RAID sistēma un kāpēc tā ir tik svarīga jūsu datiem?
RAID (Redundant Array of Independent Disks — redundants neatkarīgu disku masīvs) ir tehnoloģija, kas apvieno vairākus fiziskus diskus vienā loģiskā sējumā, lai palielinātu veiktspēju, izmantojamo ietilpību un/vai kļūdu toleranci. Tā ir vairuma serveru, NAS ierīču un SAN masīvu pamats , un to izmanto uzņēmumu vidē, mazos birojos un pieredzējuši lietotāji.
Operētājsistēma RAID uztver kā vienu vienību, lai gan patiesībā tas var sastāvēt no diviem, trim vai pat desmitiem cieto disku. Dati tiek sadalīti pa diskdziņiem atbilstoši izvēlētajam RAID līmenim: dažreiz tie tiek svītroti, dažreiz tiek spoguļoti, un augstāka līmeņa RAID līmeņos tiek aprēķināti paritātes bloki vai liekā informācija, lai diska atteices gadījumā varētu veikt datu rekonstrukciju.
Visbiežāk serveros un NAS ierīcēs izmantotie RAID līmeņi ir 0, 1, 4, 5, 6 un 10, kā arī lineārās vai JBOD konfigurācijas, kā arī specifiski dažu ražotāju varianti (RAID 50, 60, 5E, 5EE, ADG utt.). Ir arī patentētas implementācijas, piemēram, Microsoft RAID, Storage Spaces, Apple RAID, Linux RAID, ZFS RAIDZ un RAIDZ2 , kurām visām ir savas specifiskās īpašības datu atgūšanas jomā.
Ir svarīgi saprast, ka RAID neaizstāj dublējumkopijas . Labi konfigurēts RAID palielina pieejamību un pieļauj noteiktas disku kļūmes, taču tas neaizsargā pret nejaušu dzēšanu, loģiskiem bojājumiem, izspiedējvīrusiem, kontrollera kļūdām vai cilvēciskām kļūdām apkopes laikā.
Galvenie RAID līmeņi un to datu zaudēšanas riski
Dažādi RAID līmeņi atšķiras pēc tā, kā tie sadala datus un nodrošina redundanci diskos. Tas tieši ietekmē datu zaudēšanas risku un to, kā veikt datu atgūšanu.
RAID 0 (tīra svītrošana) sadala datus blokos visos masīva diskos bez jebkādas dublēšanas. Tas piedāvā augstu lasīšanas un rakstīšanas veiktspēju un izmanto pilnu ietilpību, taču, ja kaut viens disks neizdodas, tiek zaudēta pilnīga piekļuve sējumam. Katastrofas gadījumā datu atgūšana no RAID 0 masīva ir sarežģīta un parasti prasa profesionālus rīkus, lai atjaunotu bloku secību no izdzīvojušajiem diskiem.
RAID 1 (spoguļošana) dublē datus divos vai vairākos diskos, katrā saglabājot identiskas kopijas. Šis līmenis piedāvā augstu uzticamību un kļūdu toleranci : ja viens disks neizdodas, sistēma var turpināt darboties ar kopiju. Izmantojamā ietilpība ir līdzvērtīga viena diska izmēram, bet pretī tā nodrošina ievērojami uzlabotu datu lasīšanas uzticamību.
RAID 4 izmanto datu svītrošanu vairākos diskos un vienu no tiem rezervē tikai paritātes glabāšanai. Izmantojamā ietilpība ir visu disku summa mīnus viens, kas ļauj atgūt datus, ja datu disks neizdodas. Tomēr paritātes disks kļūst par sašaurinājumu un kritisku punktu konfigurācijā.
RAID 5 ir visizplatītākais RAID līmenis vidējas klases serveros un NAS ierīcēs. Tas sadala gan datus, gan paritātes joslas visos diskos, novēršot atsevišķa paritātes diska sašaurinājumu. Izmantojamā ietilpība ir masīva ietilpības summa, no kuras atskaitīta jebkura atsevišķa diska ietilpība. Tas pieļauj viena diska atteici bez datu zuduma, taču atjaunošanas laikā sistēma darbojas ar savu robežu, un jebkura otrā kļūme varētu padarīt masīvu neatjaunojamu bez eksperta iejaukšanās.
RAID 6 pievieno otru paritātes joslu, nodrošinot toleranci pret divu disku vienlaicīgu atteici. Izmantojamā ietilpība ir visu disku summa, no kuras atskaitīta divu diskdziņu ietilpība. Šis līmenis piedāvā lielāku drošību, taču tas prasa nedaudz sarežģītāku atkopšanu un dārgākus paritātes aprēķinus.
RAID 10 (1+0) apvieno spoguļus (RAID 1), kas grupēti svītrās (RAID 0). Tas nozīmē, ka tiek izveidoti spoguļotu disku pāri, un pēc tam dati tiek izplatīti starp šiem spoguļiem. Tas piedāvā lielisku līdzsvaru starp veiktspēju un kļūdu toleranci , lai gan tam nepieciešami vismaz četri diski, un izmaksas ietilpības ziņā ir augstākas.
Lineārās un JBOD konfigurācijas vienkārši savieno vienādas vai atšķirīgas ietilpības diskus, veidojot lielāku sējumu. Nav patiesas svītrošanas, paritātes vai redundances. Ja viens disks neizdodas, viss masīvs var kļūt nepieejams, un atkopšanai ir manuāli jārekonstruē katra diska robežas kopējā sējumā.
“Zelta stunda”: kritiskas kļūdas pēc RAID kļūmes
Pēc RAID kļūmes vai degradācijas brīdinājuma pirmās 60 minūtes ir kritiski svarīgas. Tieši šajā periodā notiek lielākā daļa novēršamo datu zudumu, parasti mēģinājumu dēļ "ātri salabot" problēmu bez skaidras diagnozes vai atjauninātām dublējumkopijām.
Tipiskas cilvēciskas kļūdas šajā zelta stundā ir nepareizu disku nomaiņa , īpaši korpusos ar daudzām ligzdām; vesels disks tiek izņemts, domājot, ka tas ir bojāts, un, ievietojot jaunu, tiek veikta pārbūve uz nestabila pamata. Tas var pilnībā sabojāt sējumu struktūru.
Vēl viena izplatīta kļūda ir RAID kontrollera aizstāšana ar citu vai nesaderīgu modeli, nedokumentējot sākotnējo konfigurāciju. Daudzos gadījumos paritātes, disku secības vai svītru izmēra rakstīšanas veids dažādiem kontrolleriem atšķiras, kā rezultātā masīvs var izskatīties bojāts vai tikt interpretēts ar nepareiziem parametriem.
Disku piespiedu pieslēgšana tiešsaistē vai disku inicializācija bez to stāvokļa analīzes ir arī ļoti bīstama. Inicializēšana var pārrakstīt RAID metadatus vai nodalījumu tabulas; diska pieslēgšana tiešsaistē, kad tas ir nestabils, rada papildu sliktos sektorus, un jebkurš mēģinājums atjaunot disku no fiziski bojāta diska paātrina bojājumus.
Neveiksmīgas atjaunošanas un atjaunošanas no nepilnīgām dublējumkopijām vienā un tajā pašā sistēmā ir vēl viens izplatīts katastrofu avots. Mēģinājums atjaunot RAID 5 vai RAID 6 masīvu ar bojātiem sektoriem, vispirms neklonējot diskus uz stabiliem attēliem, var radīt stāvokli, kurā pat profesionāla laboratorija nevar droši salikt masīvu atpakaļ.
Zelta likums pēc nopietnas RAID problēmas atklāšanas : nekavējoties pārtrauciet visu rakstīšanas darbību, neveiciet pārbūvi vai inicializāciju un neturpiniet "testēt lietas" ražošanas vidē. Katrs jauns ieraksts sākotnējā RAID masīvā samazina pilnīgas atkopšanas iespējas.
Specializēta programmatūra: kā tā palīdz atjaunot bojātus RAID diskus
Daudzos loģisko kļūmju scenārijos profesionāli datu atkopšanas rīki var praktiski atjaunot RAID, nerakstot sākotnējos diskos. Tipisks piemērs ir tādas programmatūras kā R-Studio izmantošana, kas darbojas ar sējumu kopu un virtuālo RAID koncepciju.
Kad sākotnējais RAID kļūst nepieejams , bet visi vai gandrīz visi diski (vai pilnīgi disku attēli) ir pieejami, profesionālais process vispirms ietver katra diska klonēšanu diska attēlā, lai saglabātu pašreizējo stāvokli. No šiem attēliem programmatūra ļauj izveidot virtuālu RAID ar tādiem pašiem parametriem kā faktiskajā sistēmā.
Virtuāls RAID tiek veidots, atlasot pareizos diskus , novietojot tos pareizā secībā un definējot precīzu konfigurāciju: disku skaitu, svītru izmēru, sākuma nobīdi, RAID veidu (0, 1, 5, 6, 10, JBOD utt.) un bloku secību (kreisā, labā, sinhronā, asinhronā, pielāgotā utt.). Kamēr tiek veikta šī loģiskā montāža, programmatūra neraksta fiziskajos diskos; viss tiek apstrādāts virtuāli.
Piemēram, vienkāršā trīs disku RAID 5 konfigurācijā vismaz diviem diskiem ir jābūt labā stāvoklī, lai mēģinātu veikt loģisku atjaunošanu. Virtuāls RAID 5 masīvs tiek izveidots, norādot trīs ierīces (vai attēlus) un bloka lielumu, un pēc tam tiek testēts, līdz tiek atrasta parametru kombinācija, kas ļauj programmatūrai noteikt derīgu nodalījumu un uzskaitīt failus.
Sarežģītākās konfigurācijās , piemēram, uzlabotā RAID 5 ar pielāgotu bloku secību, var definēt bloku secības tabulu, norādot precīzu datu secību un paritāti (P, 1, 2, 3 utt.) katrā rindā. Tehniķis ievada svītrošanas rakstu katrā rindā, un programma sarkanā krāsā izceļ nederīgas kombinācijas, palīdzot ātri identificēt konfigurācijas kļūdas.
Kad virtuālajā RAID ir atrasta konsekventa failu sistēma , mapes un faili tiek uzskaitīti, tiek pārbaudīti priekšskatījumi (īpaši lielu failu gadījumā) un tiek pārbaudīts, vai saturs ir konsekvents, bez neparastas fragmentācijas vai acīmredzamiem bojājumiem. Šis solis ir ļoti svarīgs, jo dažreiz programmatūra atrod konsekventas failu sistēmas struktūras pat tad, ja viens no RAID parametriem ir nepareizs.
Lai pārbaudītu masīva iestatījumu, parasti tiek izmantota aptuvena formula, kas palīdz izvēlēties ideālo minimālo faila lielumu priekšskatījuma testēšanai: bloka lielums reizināts ar (disku skaits mīnus 1). Piemēram, RAID 5 masīvā ar trim diskiem un 64 KB bloka lielumu vismaz 128 KB liels fails parasti nodrošina labu atskaites punktu, lai apstiprinātu datu sadalījuma un paritātes pareizību.
Profesionāli rīki ļauj arī apstrādāt trūkstošos diskus , aizstājot tos ar tāda paša izmēra "tukša diska" vai "trūkstoša diska" objektiem. Tas ir noderīgi, ja viens no diskiem ir pilnībā neatgūstams: programmatūra simulē tā klātbūtni, pamatojoties uz pārējo disku paritāti un informāciju, dažreiz ļaujot atgūt lielu daļu atlikušo datu.
Turklāt RAID konfigurācijas veidnes var izveidot, saglabāt un atkārtoti ielādēt , kā arī dinamiski pievienot vai atvienot katru disku virtuālajā RAID, lai redzētu, kā tas ietekmē masīvu. Šī funkcija ir svarīga, lai noteiktu, kurš disks RAID 5 faktiski bija bojāts, piemēram, atvienojot tos pa vienam un novērojot simulētās failu sistēmas darbību.
Biežākie RAID sistēmas kļūmju cēloņi
RAID sistēmas kļūmes var būt loģiskas, fiziskas vai cilvēka izraisītas , un tās bieži rodas kombinācijā. Lai gan RAID ir izstrādāti, lai palielinātu uzticamību, tie nav imūni pret kaskādes kļūdām vai nepietiekamu apkopi.
Paritātes joslas zudums ir loģiska problēma, kas rodas, ja informācija, ko izmanto datu rekonstrukcijai (paritāte), tiek bojāta vai nekonsekventa. Šādās situācijās pati RAID sistēma nespēj atgūt datus, un ir nepieciešama ārēja iejaukšanās, lai atrastu un pareizi rekonstruētu šīs paritātes joslas.
Fizisko disku kļūmes RAID masīvā nav daudz biežākas nekā atsevišķos diskos, taču to ietekme ir daudzkāršota, jo masīvs ir atkarīgs no tiem visiem. Tiek lēsts, ka katru gadu var sabojāties no 2% līdz 3% instalēto disku, ko ietekmē tipiskas problēmas: bojāti sektori, strāvas pārspriegumi, ekstremālas temperatūras, iestrēguši motori, bojātas lasīšanas/rakstīšanas galviņas, bojāti elektroniskie komponenti utt.
Citi faktori, piemēram, vīrusi, izspiedējvīrusi vai failu sistēmas bojājumi, var izraisīt RAID pareizas pievienošanas pārtraukšanu vai, pat ja tas šķiet “tiešsaistē”, padarīt nodalījumu vai loģisko sējumu nepieejamu. Nepareizi instalēti draiveri, neveiksmīgi programmaparatūras atjauninājumi vai atkārtoti strāvas padeves pārtraukumi var arī sabojāt RAID metadatus.
Situācija kļūst sarežģītāka, ja pēc kārtas rodas divas vai vairākas kļūmes . Piemēram, RAID 5 masīvā, kur viens disks nolietojas un netiek nekavējoties nomainīts, ja atjaunošanas procesa laikā sāk bojāties otrs disks, sistēma vairs nespēj automātiski atjaunot datus. Turpmāk jebkurš mēģinājums veikt remontu bez profesionālas metodoloģijas var neatgriezeniski pasliktināt bojājumus.
Cilvēciskā kļūda ir neapšaubāmi visbīstamākais iemesls : diska atstāšana atzīmēta kā bojāta, to nenomainot, degradācijas brīdinājumu ignorēšana, disku jaukšana no dažādiem masīviem, sistēmas izslēgšana atjaunošanas laikā vai nepareizu opciju izvēle kontrollera programmaparatūrā. Daudzos no šiem gadījumiem galīgo bojājumu nerada sākotnējā kļūme, bet gan nepietiekama reakcija.
Profesionāls datu atgūšanas process RAID sistēmās
Specializētās laboratorijas ievēro ļoti stingru darbplūsmu , lai maksimāli palielinātu datu atgūšanas iespējas no neveiksmīga RAID. Lai gan katrs gadījums ir atšķirīgs, vispārējā procedūra parasti ir līdzīga.
Vispirms tiek veikta tehniskā diagnostika , kas parasti ir bez maksas un bez saistībām pie daudziem profesionāliem pakalpojumu sniedzējiem. Tas ietver RAID līmeņa, kontrollera vai NAS ražotāja un modeļa, disku skaita un veida, katra diska fiziskā stāvokļa un visu novēroto simptomu (degradācijas, sāknēšanas kļūmes, mehānisku trokšņu, lasīšanas kļūdu utt.) noteikšanu.
Pēc tam atlikušie funkcionējošie diski tiek klonēti sektoru pa sektoram . Šis solis ir ļoti svarīgs: oriģinālie datu nesēji nekad netiek apstrādāti ilgstoši, jo bojāta galviņa, saskrāpēta plate vai nestabili sektori atkopšanas laikā var izraisīt turpmāku bojāšanos. Kopijas tiek veidotas, izmantojot forenzikas aparatūru un programmatūru, kas spēj apstrādāt lasīšanas kļūdas, kontrolējot atkārtotu mēģinājumu skaitu un gaidīšanas laikus.
Izmantojot visu pieejamo disku attēlus , RAID tiek loģiski rekonstruēts izolētā vidē. Tiek noteikti tādi parametri kā bloka lielums, disku secība, paritātes tips un visas ražotāja specifiskās variācijas (piemēram, specifiskas RAID 5, RAID 6, RAID 50 vai RAID 60 implementācijas). Jauktās vai sarežģītās konfigurācijās tiek analizēti arī papildu slāņi, piemēram, LVM, sējumu pārvaldnieki, šifrēšana un failu sistēmas, piemēram, ZFS, ext4, Btrfs, XFS, HFS+, NTFS utt.
Kad virtuālais RAID ir uzstādīts , tiek mēģināts atrast un uzstādīt failu sistēmu. Ja tiek atrasts derīgs nodalījums, tiek uzskaitīta direktoriju struktūra un veiktas integritātes pārbaudes: kritisko failu priekšskatījums, datubāzu, virtuālās mašīnas failu, attēlu utt. pārbaude. Ja ir daļēja bojājuma gadījumā failu sistēmas rekonstrukcijas metodes tiek apvienotas ar noteiktu failu tipu "neapstrādātu" (uz parakstu balstītu) atkopšanu.
Kad laboratorija ir pabeigusi analīzi , tā parasti sniedz klientam atgūstamo failu sarakstu pārskatīšanai pirms pakalpojuma apstiprināšanas. Tikai pēc tam atgūtie dati tiek kopēti uz jauniem ārējiem cietajiem diskiem vai saskaņotu ierīci, nekad uz sākotnējo RAID masīvu, kas paliek neskarts, ja kāda procesa daļa ir jāatkārto vai jāpārskata.
Profesionāli datu atkopšanas pakalpojumi parasti strādā ar visu veidu disku zīmoliem (Seagate, Western Digital, Toshiba, Samsung, Crucial, SanDisk, Kingston, LaCie u. c.) un plašu RAID kontrolleru un korpusu klāstu: sākot no serveru SAS/SATA RAID kartēm līdz ārējām Thunderbolt, USB, iSCSI, Fibre Channel risinājumiem, komerciāliem NAS masīviem vai uzņēmumu krātuves sistēmām.
Labākā prakse un kļūdas, no kurām jāizvairās RAID kļūmes gadījumā
Ja jūsu RAID sāk rasties problēmas , ir vairākas darbības, no kurām jums vajadzētu izvairīties par katru cenu, ja neesat datu atkopšanas speciālists. Daudzas pilnīgas katastrofas varēja mazināt, vienkārši nepieskaroties noteiktām pogām.
Nekad neveiciet aklo atjaunošanu . Kontrolieris vai NAS vednis parasti piedāvā opciju "pārveidot" vai "pārveidot masīvu", tiklīdz tas atrod jaunu disku. Ja sistēmā ir bijušas vairākas kļūmes, informācija par to, kuri diski bija derīgi un kuri nebija, var būt novecojusi, un atjaunošana šādos apstākļos varētu neatgriezeniski iznīcināt derīgo paritāti.
Nenomainiet diskus, vispirms nenoskaidrojot, kuri no tiem ir sabojājušies un kad . Nepareiza diska nomaiņa var piespiest sistēmu uzskatīt disku, kurā ir novecojuši dati, par "labu". RAID masīvos, piemēram, RAID 5 vai RAID 6, kļūmju secība un precīzs laiks ir ļoti svarīgi, lai nodrošinātu datu integritāti, kas jāapvieno atjaunošanas laikā.
Neizslēdziet RAID notiekošas pārbūves laikā, ja vien kvalificēts tehniķis nav devis īpašus norādījumus to darīt un tas netiek veikts kontrolētos apstākļos. Pārbūves laikā redundanci parasti atspējo, un sistēma darbojas ļoti nestabilā stāvoklī. Strāvas padeves pārtraukums, strāvas padeves pārtraukšana vai piespiedu restartēšana var atstāt RAID starpposma stāvoklī, no kura tas nevar atgūties.
Nemēģiniet fiziski remontēt diskus paši . Cietā diska atvēršana ārpus tīras kameras, tā sišana, sasaldēšana vai jebkurš cits internetā cirkulējošs "dari pats" triks ne tikai nepalīdzēs, bet var pilnībā iznīcināt disku magnētisko virsmu, likvidējot jebkādas izredzes uz panākumiem pat profesionālai remontdarbnīcai.
Ja no jebkura RAID masīva diska dzirdat dīvainas skaņas, klikšķus vai čīkstēšanu , drošākā rīcība ir droši izslēgt sistēmu un nerestartēt to, kamēr tā nav novērtēta. Atkārtota piespiedu sāknēšanas procesa veikšana ar mehāniski bojātu disku bieži vien izraisa lasīšanas/rakstīšanas galviņu bojājumus, kas saskrāpē disku.
Jebkurā nopietnā situācijā vispārējs ieteikums ir apturēt visas darbības, mierīgi dokumentēt notikušo (kļūdu ziņojumus, datumus, jaunākās aparatūras vai programmatūras izmaiņas) un sazināties ar dienestu, kas specializējas RAID datu atgūšanā. Jo mazāk iepriekšēju manipulāciju, jo lielāka ir veiksmes iespējamība un zemākas iejaukšanās izmaksas.
Lai gan mūsdienu RAID sistēmas ir ļoti stabilas un datu glabāšanas tehnoloģijas katru gadu uzlabojas ietilpības un uzticamības ziņā, regulāras dublējumkopijas atsevišķos datu nesējos joprojām ir būtiskas. Ar labu dublēšanas plānu un vēsu prātu jebkuras kļūmes gadījumā, profilakses un specializētu profesionālu pakalpojumu kombinācija nodrošina, ka pat nopietnu RAID katastrofu gadījumā kritiskas informācijas atgūšanas iespējas joprojām ir ļoti augstas.
