Maikling sagot: Ang isang AI data center ay isang na may mataas na densidad kung saan ang kuryente, pagpapalamig, tela, at imbakan ay nakatuon sa mga modelo ng pagsasanay at paglilingkod, hindi isang silid ng server na may mga karagdagang GPU. Ang mga chip ang sumisikat; ang gusali ang magpapasya kung gagana ang mga ito. Kung hindi makaalis ang mga imahe, mag-retrofit ng isang maliit na cell; karamihan sa mga koponan ay dapat umupa.
Mga pangunahing punto:
Chips vs. Building: Ang kuryente, pagpapalamig, tela, at imbakan ang magpapasya kung gumagana ang mga accelerator.
Mga lugar hindi palasyo: Ayusin ang dalawang rack kapag hindi makaalis ang data; huwag bumili ng campus.
Mean vs median: Sa walong pagtakbo, magsisimula muli ang median; gamitin ang 18-oras na mean.
Pagtutol sa Maling Paggamit: Huwag magbigay ng quotation ng PUE para sa dalawang rack sa isang mixed hall.
Mga naglalarawang resulta: Walong pagtakbo ay isang maliit na mapa, hindi isang 50% na natitipid sa produksyon.

Mga artikulong maaaring gusto mong basahin pagkatapos nito:
🔗 Maaasahan ba ang AI? Video at pagsusulit
Galugarin ang pagiging maaasahan ng AI sa pamamagitan ng isang nakakaengganyong video at interactive na pagsusulit.
🔗 Paano gamitin ang AI sa pang-araw-araw na buhay
Tuklasin ang mga praktikal na paraan kung paano mapapasimple ng AI ang mga pang-araw-araw na gawain at gawain.
🔗 Paano gamitin ang AI sa trabaho
Alamin ang mga praktikal na paraan upang magamit ang AI para sa mas matalinong produktibidad sa lugar ng trabaho.
🔗 Kaya bang mag-isip ang AI para sa sarili nito?
Unawain kung ang artificial intelligence ay tunay na kayang mag-isip nang mag-isa o mangatwiran.
Paano ito naiiba sa isang "normal" na data center
Ang mga tradisyunal na bulwagan ay nag-o-optimize para sa magkahalong workload at uptime sa maraming maliliit na serbisyo. Mahalaga sa iyo ang redundancy, siyempre, at ang PUE bilang isang konsepto - dagdag na enerhiya na ginugugol ng gusali upang makapaghatid ng isang watt ng compute. Hindi mo, karaniwang, dinisenyo ang bawat koridor sa paligid ng isang rack na kumikilos na parang isang portable heater farm.
Binabago ng mga AI site ang mga ratio. Tumataas ang densidad. Ang network ay nagiging isang tela na hindi maaaring maglakad nang paika-ika kung wala ang trabaho sa pagsasanay. Kailangang panatilihing gumagalaw ng storage ang mga checkpoint o kaya'y nakatigil ang mga accelerator, tulad ng mga kabayong pangkarera sa gitna ng trapiko.
Mayroon ding pagkakaiba sa kultura. Ang mga enterprise ops ay nag-iisip sa mga ticket at change window. Ang mga AI ops ay nag-iisip sa mga pila ng trabaho at ang pakiramdam ng pagkahilo kapag ang isang node ay namamatay nang huli sa kalaunan. Sa palagay ko ay maaari mo pa ring tawagin ang parehong "data center" dahil ganoon nga. Itinatago lang ng label ang tubo.
| Uri | Para saan ito itinayo | Namumukod-tanging hardware | Katangian ng lakas / pagpapalamig | Kung sino ang nababagay dito | Bakit ito umiiral |
|---|---|---|---|---|---|
| Tradisyonal na sentro ng datos ng negosyo | Halo-halong IT: mga database, VM, email, mga file | Mga CPU, mga ordinaryong server, pamilyar na imbakan | Pinapatakbo ng hangin; katamtamang densidad; PUE bilang pinag-uusapang punto | Mga kompanyang nagpapatakbo ng mga pang-araw-araw na sistema | Panatilihing naka-on ang mga business app |
| Kumpol ng pagsasanay sa AI | Mahahaba at mahigpit na magkakaugnay na mga trabaho sa pagsasanay | Mga siksik na rack ng accelerator; mga interconnect ng GPU | Mataas na densidad; likidong pagpapalamig o [mga heat exchanger sa likurang pinto](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Mga laboratoryo at tagapagtayo ng modelo na naninirahan sa pila ng trabaho | Tapusin ang takbo nang hindi nauubos ang chips |
| Pasilidad ng paghihinuha ng AI | Paghahatid ng modelo; mga sagot sa real-time at batch | Mga Accelerator; mga load balancer na mahalaga | Mainit pa rin, basta... hindi gaanong palabas; latency over brute density | Mga produktong kailangang sagutin ngayon | Ilagay ang modelo malapit sa gumagamit |
| Hall ng Hybrid AI | Pagsasanay at paglilingkod sa ilalim ng iisang bubong; medyo | Halo-halong mga rack; mga nababakurang pool; pinagsasaluhang tela | Dalawang nakakatuwang personalidad sa iisang silid ng halaman;; nagiging awkward | Mga koponan na hindi kayang bumili ng dalawang kampus | May hangganan ang kapital; magulo ang buhay |
Hindi moral na ranggo. Magkaibang makina, iisang apelyido.
Mga GPU, accelerator, at ang rack na kumakain ng kuryente
Maglakad sa tradisyonal na nakataas na sahig at ang mga rack ay magmumukhang halos magalang. Maglakad sa isang hanay ng AI at parang gusto nilang lamunin ang gusali.
Ang namumukod-tanging hardware ay hindi isang matalinong CPU. Ito ay ang accelerator tray: mga GPU o iba pang AI chips, na naka-pack sa mga server, pagkatapos ay mga rack, pagkatapos ay mga row na nagbabahagi ng isang high-bandwidth fabric. Pinagdudugtong ng GPU ang mga chips sa isang bagay na maaaring magkunwaring isang higanteng accelerator; ginagawa rin ng cluster fabric ang parehong trick sa row scale. Gagana lamang ang parallel training kung ang mga link na iyon ay mananatiling makapal at predictable. Kung mawawala iyon, ang iyong "cluster" ay magiging isang tambak ng mga mamahaling workstation na nagbabahagi ng isang postcode.
Ang kuryente ay sumusunod sa mga chips. Hindi isang malaking PDU ng opisina. Megawatts ng IT load kapag napuno ang isang hall - hindi ako mag-iimbento ng numero. Ang densidad bawat rack ang plot twist. Mas kaunting rack. Bawat isa ay parang maliit na furnace. Ang limiting factor ay kadalasang ang substation, hindi ang wishlist ng mga GPU. Alam mo naman kung paano: ang procurement ay gusto ng mas maraming accelerator; ang utility ay gusto ng mahabang pag-uusap at napakalaking tseke.
Isang medyo kalokohang metapora ang hindi ko maalis sa isipan ko: ang patungan ay isang gutom na hayop. Maaari kang magparami ng mas mabilis. Kailangan mo pa rin itong pakainin, at kailangan mo pa ring alisin ang init. Kung hindi mo isa man ang gawin, magiging napakamahal nitong pabigat.
Problema sa kuryente, init, at paglamig
Kuryente papasok. Init palabas. Iyan ang buong relihiyon.
Ang mga high-density rack ay naglalabas ng init sa paraang hindi talaga hinihiling na hawakan ng hangin. Maaari mong itulak ang hangin nang mas malakas - mga heat exchanger sa likurang pinto, mas mainit na mga pasilyo, matalinong pagpigil - at gumagana iyon hanggang sa isang punto. Pagkatapos ay lumilitaw ang likido:
-
Mga coolant loop na nagpapamukhang gumagana ang plant room na parang may kemikal
-
Paglulubog sa ilang disenyo, na nakakagulat pa rin sa mga taong nag-iisip na ang tubig at mga tagapagsilbi ay hindi dapat magbahagi ng isang pangungusap
Wala sa mga ito ang kaakit-akit. Lahat ng ito ay produkto, dahil ang isang accelerator na nagpapabilis ay isa na binayaran mo na at hindi mo pa lubos na magagamit.
Mahalaga pa rin ang PUE. Ito ay isang ratio, hindi isang personalidad. Hinahabol ito ng mga operator dahil ang bawat watt na ginagastos sa mga bentilador at bomba ay isang watt na hindi napupunta sa isang GPU. Hindi ko babanggitin ang isang "tipikal" na pigura; ang klima at kung paano mo iginuguhit ang hangganan ang nagpapagalaw nito, at ang pekeng katumpakan ay mas masahol pa kaysa sa wala. Ang tubig ay nananatiling bahagi rin ng kwento. Ang ilang halaman ay humihigop. Ang ilan ay lumulunok. Ang evaporative cooling ay mabisa hanggang sa ang ilog o ang tagtuyot ay maging sanhi ng politikal na sitwasyon.
Networking: kung bakit mahalaga ang tela gaya ng mga chips
Kinukuhanan ng litrato ng mga tao ang mga GPU. Dapat nilang kunan ng litrato ang mga switch.
Ang pagsasanay ay isang pag-uusap. Libu-libong accelerator ang nagpapalitan ng mga gradient, parameter, at piraso ng isang modelo, nang mahigpit na naka-sync. Kung ang tela ay nababagabag, ang buong trabaho ay naghihintay sa pinakamabagal na paglukso. Kaya naman ang AI ay nahuhumaling sa high-bandwidth networking, mababang latency, at mga topology na hindi natitiklop sa kalahati kapag ang isang link ay nabigo. Mga tela na parang InfiniBand, Ethernet na nasa parehong papel, mga GPU interconnect sa loob ng kahon, mga kable na dapat tama sa unang pagkakataon.
Ibang usapan ang hinuha. Ang model serving ay mahalaga sa tail latency - ang mabagal na sagot, hindi ang karaniwan. Ang batch vs real-time ay naghahati sa personalidad. Ang isang training cluster ay nagnanais ng malaki, kolektibo, at parang all-to-all na paggalaw. Ang isang serving fleet ay nagnanais ng maraming mas maliliit na request at paghihiwalay, nang walang traffic jam sa load balancer.
Ang miss, habang nandito ako: tinatrato ng mga tao ang network bilang tubo at ang mga chips bilang restawran. Sa gusaling ito, ang tubo ay ang restawran. Kung hindi mo iyon magawa, bibili ka ng kusina na hindi tumatanggap ng delivery.
Pagsasanay vs hinuha: dalawang gusali, minsan literal
Ang pagsasanay ay isang kampanya. Binubuo mo ang isang cluster, pinapakain ito ng data, regular na nagche-checkpoint, tumatakbo nang ilang oras o linggo, at nananalangin na manatiling maayos ang lahat. Maraming batch, uhaw sa bandwidth, tahimik na matiyaga - hanggang sa ang isang sirang node ay makawala sa pagtakbo. Ang isang patay na accelerator sa isang mahigpit na konektadong trabaho ay maaaring makapagpahinto sa buong koro.
Ang inference ay isang shopfront. Ang mga modelong sinanay na, ngayon ay sumasagot sa mga tanong, nag-uuri ng mga imahe, at bumubuo ng teksto. Mahalaga ang latency. Ang isang medyo lumang accelerator na malapit sa customer ay maaaring talunin ang isang kaakit-akit na accelerator sa isang kontinente ang layo.
Kaya nagkakaroon ka ng hatian. Hinahabol ng mga training campus ang kapangyarihan, lupain, at densidad. Hinahabol naman ng mga inference site ang latency at presence. Mayroon ding mga hybrid hall, dahil ang kapital ay hindi walang hanggan. Hindi laging dalawang gusali. Minsan, isang hall na may lubid na pelus at dalawang cooling loop.
Dito rin matatagpuan ang colocation, hyperscale campuses, at on-prem fork. Ang mga hyperscaler ay bumubuo sa mga sukat na nagpapamukha sa ating lahat na nag-aayos ng mga muwebles. Ang mga Colos ay nagbebenta ng density ayon sa rack. Nangyayari pa rin ang on-prem kapag hindi makaalis ang data.
Throughput ng imbakan, mga checkpoint, at mga hungry chip
Walang naglalagay ng parallel file system sa pabalat ng brochure.
Kailangang dumating nang mabilis ang training data para hindi mag-abala ang mga GPU. Kailangang dumating ang mga checkpoint para hindi masira ang isang linggo kapag may crash. Kailangang mag-load ang mga weight ng modelo bago magamit ang isang replica na inihahain. Ang throughput ng storage - hindi lang ang kapasidad - ang tahimik na bottleneck. Maaari kang gumastos nang malaki sa mga accelerator at pabayaan ang mga ito gamit ang isang magalang na array na idinisenyo para sa mga virtual machine.
Pamilyar ang padron: isang makintab na kumpol, isang pila ng trabaho, at paghihintay sa I/O na parang isang bastos na invoice. Ang pag-clustering ng compute nang hindi pinag-clustering ang data path ay kung paano ka makakakuha ng napakamahal na idle. Panatilihing naka-on ang mga chips o aminin na bumili ka ng isang iskultura.
Software, orkestrasyon, at ang hindi kaakit-akit na ops layer
Ang hardware ang sikat. Ang mga scheduler ang gumagawa ng trabaho.
Walang silbi ang isang AI data center kung hindi mahanap ng mga trabaho ang mga GPU, kung hindi maaaring magbahagi ng cluster ang dalawang team nang walang suntukan, kung hindi mapapalitan ang isang bagsak na ranggo, kung ang firmware ay magbabago nang mabagal hanggang sa mabigo ang fabric. Orchestration, observability, power capping - ang hindi kaakit-akit na ops layer, na siyang paraan para malaman mong mahalaga ito.
May malambot akong puso para sa layer na ito. Gayundin, kapag ang isang maling na-configure na NIC ay nagpapanggap na isang problema sa paglamig sa loob ng isang buong hapon... malalaman mo iyan sa mahirap na paraan.
Kapag namatay ang isang node sa kalagitnaan ng pagtakbo
Namamatay ang isang node. Nababangga pa rin ang mga window ng pagbabago sa mga training run na walang pakialam sa iyong kalendaryo. Nag-iiskedyul ka ng malalaking trabaho, binabakuran ang mga inference pool, nagsusulat ng mga runbook para sa mga failure na mukhang "mabagal ang trabaho" hanggang sa magmukhang "patay na ang trabaho." Mahalaga pa rin ang redundancy - power, cooling, paths, storage - ngunit ang failure mode ay hindi gaanong maayos kumpara sa lumang siyam na uptime slide. Inference: replica, alisan ng tubig ang sick node, patuloy na sumagot. Ang gusto ng training ay mga checkpoint, hindi optimismo.
Lokasyon, tubig, grid, at mga kapitbahay
Hindi mo ilalagay ang isa sa mga ito sa tabi ng isang kubo para lang sa tanawin.
Ang koneksyon sa grid ay kadalasang ang tunay na proseso ng pagpili ng lugar. Madali ang lupa kumpara sa isang substation at isang utility na may ibang mga customer. Ang tubig para sa pagpapalamig, kung gagamitin mo ito, ay nagiging isyu sa kapitbahay sa sandaling lumakas ang ulan. Ingay. Biswal na bulto. Init sa bakod sa hangganan. Natutuklasan ng mga komite sa pagpaplano ang mga opinyon tungkol sa "ulap" sa sandaling kailanganin nito ang isang bukid at isang ilog.
Ang latency ay nakakaakit sa kabilang direksyon. Ang inference ay gusto ang pagiging malapit sa mga gumagamit at magkakaugnay. Ang training ay maaaring magtago sa mas murang pamilihan ng kuryente at mas malamig na klima. Ang industriya ay nagsasalita na parang mayroong isang perpektong lugar. Wala. Mayroong kompromiso sa isang press release.
Natirang init at ang hindi inanyayahang pugon
Gustong-gusto ng mga brochure ang bahaging ito. Ibuhos ang init ng basura sa mga bahay, swimming pool, at greenhouse; napakagandang pangungusap nito. Minsan, totoo ang district loop. Minsan, nasa maling lugar ang campus at napupunta pa rin ang init sa hangin. Nagdududa ako sa bersyon ng brochure; hindi ako nagdududa sa physics.
Sino ang nangangailangan nito (at sino ang dapat umupa)
Hindi kailangang magmay-ari ng isa sa mga bulwagang ito ang karamihan ng mga tao.
Ang prangka na listahan:
-
Mga hyperscaler, dahil ang produkto ay ang fleet
-
Mga Lab, kapag ang oras ng pila ang hadlang, o hindi makaalis ang data
-
Ang isang bangko, grupo ng ospital, gobyerno, o tagagawa na may lihim na dataset - on-prem o isang pribadong colo cage ay maaaring maging makatuwiran, kahit na ito ay isang kalokohan
Dapat umupa ang lahat. Colocation na may AI-ready density. Isang cloud reservation. Isang managed cluster. Makukuha mo ang mga accelerator nang hindi ka nagiging operator ng power plant. Nawawala ang romansa sa unang pagkakataon na may magtanong kung sino ang on call para sa coolant loop ng alas-3 ng umaga.
May pagka-mapagmataas, aaminin ko. Ang pagmamay-ari ng cluster ay parang pagmamay-ari ng paraan ng paghula. Pagkatapos ay dumating ang singil sa kuryente, at uupo ang pride.
Para saan ang gusali
Kaya, ano ang isang AI Data Center? Isang espesyalisado at high-density na kampus kung saan ang mga accelerator, power, cooling, fabric, at storage ay nakaayos batay sa mga modelo ng pagsasanay at paglilingkod - hindi pangkalahatang IT na may GPU sa sulok. Mukha itong bodega. Gumagana ito na parang isang power station na gumagawa ng matematika.
Kung wala ka nang ibang maalala: ang mga chips ang sumisikat; ang substation, ang coolant, at ang network ang magpapasya kung magandang ideya ang mga chips na iyon. Ang pagsasanay at paghihinuha ay maaaring magbahagi ng bubong; gusto pa rin nila ng iba't ibang kaugalian. Karamihan sa mga organisasyon ay dapat umupa. Iilan ang dapat magtayo. Mapapansin ng mga kapitbahay ang alinmang paraan.
Ang cloud ay palaging may gusali. Sa mga panahong ito, ang gusali ay may mga opinyon.
Halimbawa sa totoong buhay: Isang two-rack training cell kapag hindi makaalis ang mga imahe
Senaryo
Si Tomos ang pinuno ng imprastraktura sa Kestrel Precision, isang tagagawa na may kapasidad na 400 katao sa West Midlands. Mayroon na silang maliit na on-prem hall: ERP, mga file share, mga virtual machine, ang magkahalong kapitbahayan na sinimulan ng artikulong ito. Air cooling. Ordinaryong Ethernet. Isang SAN na lubos na magalang para sa mga office disk.
Kailangang sanayin ng machine-vision team ang isang modelo ng inspeksyon sa mga factory still. Hindi maaaring umalis sa site ang mga still. Ipinapakita nito ang isang prosesong hindi ilalagay ng kumpanya sa isang cloud disk, kahit pribado pa. Ang solusyon ng Procurement ay apat na dual-accelerator server at isang slide na pinamagatang "our AI data center". Ang mga server ay pumupunta sa dalawang umiiral na rack, dahil may espasyo, at ang espasyo ay parang limitasyon.
Hindi naman. Sa loob ng dalawang linggo, parang abala ang mga GPU at pagkatapos ay tahimik na humihinto. Gumagapang ang mga trabaho kapag may checkpoint na tumama sa SAN. Namamatay ang isang node sa oras na labing-isa at ang operasyon ay... wala na. Hindi nabigo si Tomos na bumili ng mga chips. Bumili siya ng isang tumpok ng mga mamahaling workstation na nagbabahagi ng postcode. Ang gusali ay isa pa ring enterprise hall.
Hindi nila kailangan ng kampus, bagong substation, o ilog. Kailangan nila ng isang maliit na cell na kumikilos na parang isang maliit na AI data center: kuryente na kayang hawakan ng mga rack, init na umaalis nang hindi naluluto ang mga chips, tela na maaaring pag-usapan ng training job, imbakan na maaaring tumagal ng checkpoint, at isang runbook para sa oras na mamatay ang isang node. Dahil hindi makakaalis ang mga imahe, ang pagrenta ng colo cage na apatnapung minuto ang layo ay hindi ang solusyon. Ang pag-retrofit ng dalawang rack ay ang solusyon.
Ang kailangan ng selula
-
Isang nasukat na badyet ng kuryente sa hanay na iyon, mula sa mga PDU, hindi mula sa wishlist ng GPU. Kung ang ekstrang kapasidad ay hindi makakapagpakain sa apat na server sa training load, doon na titigil ang pag-uusap at titingnan nila ang isang mas siksik na kulay, hindi isang himala
-
Hindi kailanman hiniling na hawakan ang pagpapalamig ng hangin sa ganitong densidad: mga heat exchanger sa likurang pinto kung kaya ng bulwagan, o isang maliit na liquid loop kung kaya nito. Kung wala sa mga ito, hindi papasok ang mga server
-
Isang nakalaang high-bandwidth fabric sa pagitan ng apat na node, hindi ang office Ethernet. Kung ang vendor ay mayroon lamang 10 Gb switch sa katalogo, hindi iyon isang cluster
-
Lokal na mabilis na imbakan para sa mga checkpoint at training shard, hindi ang VM SAN
-
Isang scheduler, isang checkpoint interval, at isang nakasulat na restart path. Ang hardware ang sikat. Ang layer na ito ang trabaho
-
Isang nababakurang kahon ng paghihinuha para sa linya ng pabrika, hiwalay sa daldalan ng pagsasanay, dahil ang paghahatid ay nangangailangan ng latency ng buntot at paghihiwalay, hindi isang kolektibo
-
Pahintulot na i-log ang power, mga orasan ng GPU, mga kaganapan ng throttle, at orasan sa dingding ng trabaho. Kung hindi nila masisiyasat ang mga iyon, kukuhanan nila ng litrato ang mga GPU at hindi nila makikita ang mga switch
Halimbawang tagubilin
Inilalahad ito ni Tomos sa maikling pahayag tungkol sa mga pasilidad, sa ordinaryong wika:
Huwag itong tawaging AI campus. Gumawa ng two-rack training cell sa kasalukuyang hall para sa apat na dual-accelerator server. Ang mga factory image ay mananatili sa site. Ang tagumpay ay: ang apat na node ay kumukumpleto ng 12-epoch inspection-training recipe nang walang thermal throttle, magsusulat ng checkpoint sa loob ng ilang minuto hindi sampu-sampung minuto, at magpapatuloy mula sa checkpoint na iyon kapag sinasadya nating napatay ang isang ranggo. Ang pagpapalamig ay dapat panatilihin ang mga GPU sa kanilang mga training clock. Ang networking ay dapat na isang tela na pinagsasaluhan ng apat na kahon na iyon, hindi isang landas sa office stack. Ang storage ay dapat pakainin ang mga chips. Kung hindi kasya ang mga rear-door heat exchanger, sabihin ito at itigil. Huwag magbigay ng PUE para sa dalawang rack sa isang mixed hall. Ang numerong iyon ay magiging theatre.
Pagkatapos ay inilalagay niya ito sa mismong trabaho sa pagsasanay:
Mag-checkpoint kada 30 minuto papunta sa lokal na fast pool. Kung may mamatay sa ranggo, magsimula muli mula sa huling kumpletong checkpoint. Huwag maghintay sa SAN. Huwag magpatuloy sa pagsasanay habang bumababa ang orasan mula sa heat. I-log ito at huminto para makita natin ang stall.
Ganito ang hitsura ng isang magandang oras: lahat ng walong GPU ay nasa training clock, naka-landing na ang checkpoint file, at maayos pa rin ang trabaho. Ganito ang hitsura ng isang masamang oras: mga fan na naka-full shout, naka-down na ang oras, nakasulat na ang checkpoint 2% pagkatapos ng sampung minuto, at may tao sa opisina na nagsasabing "up na ang cluster". Ang up ay hindi pagsasanay.
Paano ito subukan
Isinusulat nila ang pagsubok bago ang retrofit, na siyang buong punto ng hindi pagtitiwala sa isang demo.
-
Ang parehong 12-epoch na recipe, parehong 120,000 inspection stills, walong runs
-
Ang tiyempo ay nakabatay sa orasan hanggang sa isang natapos na recipe, kasama ang anumang pag-restart, sinusukat mula sa pagsumite ng trabaho hanggang sa huling checkpoint ng epoch 12
-
Isang paglampas sa init: Ang mga orasan ng GPU ay nananatili sa target na pagsasanay para sa pagtakbo. Ang isang throttle event ay isang pagkabigo kahit na matapos ang trabaho sa kalaunan
-
Isang pass sa storage: oras ng pagsulat sa checkpoint, median at pinakamasama, mula sa job log
-
Isang pasa sa tela: ang trabaho ay hindi kolektibong naghihintay habang malusog ang isang ranggo. Kung hindi nila nakikita ang paghihintay na iyon, hindi pa tapos ang paggamit ng mga instrumento
-
Dalawa sa walong runs ang sadyang nakakapatay ng ranggo sa isang takdang step para subukan ang restart path
-
Ang hinuha ay isang hiwalay na pagsubok na may 200 imahe mula sa linya ng pabrika hanggang sa nababakurang kahon ng paghahatid. Ang tagumpay sa pagsasanay ay hindi binibilang bilang tagumpay sa paghahatid
-
Nire-record nila ang rack power mula sa mga PDU sa loob ng 15 minutong sample kaya walang kailangang mag-imbento ng megawatt
Pagtanggap sa pagtawag sa cell na "AI-ready": 8 sa 8 recipe ang natapos; 0 sa 8 ang nagpapakita ng thermal throttle; parehong nagpatuloy ang mga napatay na run; ang mga checkpoint ay mananatili sa loob ng ilang minuto. Kung hindi nila iyon mapapansin, mayroon pa rin silang server room na may mga magagarang graphics card.
Resulta
Paglalarawang resulta, mula sa isang gawa-gawang walong-run na pagsubok, hindi isang nailathalang pigura ng Kestrel.
Mga Pagpapalagay: apat na dual-accelerator server sa dalawang rack; isang inspection model; 120,000 stills; walong run ng isang fixed 12-epoch recipe; kasama sa wall-clock ang mga restart hanggang sa matapos ang recipe; ang throttle ay nangangahulugang isang naka-log out na orasan ng pagsasanay; ang oras ng checkpoint ay ang nakasulat, hindi ang nais; ang rack power ay mga sample ng PDU, hindi isang campus PUE.
Bago ang retrofit, ang mga GPU sa mga ordinaryong air-cooled rack sa office Ethernet at sa VM SAN:
-
5 sa 8 runs ang natapos sa unang pagsubok. Median na orasan sa dingding sa limang iyon: 14 na oras
-
3 sa 8 ang kinailangang magsimulang muli matapos ang isang pagtigil sa trabaho bandang ika-11 ng oras (dalawa matapos mamatay ang isang node dahil sa isang lumang checkpoint, isa matapos mapuno ng isang checkpoint ang SAN). Agad na pagsubok muli, walang magdamag na paghihintay sa orasan: 11 oras na nasayang kasama ang 14 na oras na pangalawang pagsubok, o 25 oras hanggang sa matapos ang isang recipe sa tatlong iyon
-
Ang karaniwang oras bago matapos ang isang recipe sa lahat ng walo, kasama ang mga pag-restart: 18 oras. (Lima sa 14, tatlo sa 25. Ang median ng lahat ng walo ay 14 pa rin, na magtatago sa mga pag-restart. Kaya naman ang mean ang baseline dito.)
-
Nakapagtala ang thermal throttle ng 7 sa 8 runs. Median time sa pinababang orasan: 3 oras sa 14 na oras na pagsubok
-
Pagsulat sa checkpoint: median na 22 minuto
-
Hindi nila kayang lampasan ang pagsusulit na Rank-kill. Wala silang runbook. Ang dalawang aksidenteng pagkamatay ang natuklasan
-
Pinakamataas na IT load sa dalawang rack habang nagsasanay: humigit-kumulang 18 kW. May watts ang hanay. Wala itong cooling o fabric
Pagkatapos ng mga heat exchanger sa likurang pinto sa dalawang rack na iyon, isang nakalaang tela sa pagitan ng apat na node, isang maliit na NVMe pool para sa mga checkpoint, 30-minutong checkpointing, at isang restart runbook:
-
8 sa 8 ang natapos sa unang pagsubok. Median na orasan sa dingding: 9 na oras
-
Thermal throttle: 0 ng 8
-
Pagsulat sa checkpoint: median na 90 segundo. Pinakamasama sa set: 3 minuto
-
Ang dalawang sinadyang rank-kill ay parehong nagpatuloy mula sa huling 30 minutong checkpoint. Dagdag na orasan sa dalawang pagtakbo na iyon: mga 40 minuto bawat isa, kasama ang diagnosis, kaya ang dalawang iyon ay naupo nang halos 9 na oras at 40 minuto. Ang ibig sabihin sa walong hindi gumagalaw na bala ay 9 na oras
-
Ang pinakamataas na IT load ay nasa humigit-kumulang 18 kW pa rin. Parehong mga chips. Magkaiba ang kilos ng gusali
Sa sample na ito, ang average na oras-hanggang-matapos-ang-recipe ay bumaba mula 18 oras patungong 9 na oras, o 9 na oras bawat isa, 72 oras sa walong pagtakbo. Ang natapos-sa-unang-pagtakbo ay bumaba mula 5 sa 8 patungong 8 sa 8. Ang throttle ay bumaba mula 7 sa 8 patungong 0 sa 8. Ang huling numerong iyon ang nagsasabi kung bumili sila ng mga accelerator o paperweight. Hindi nila ituturing na 50% na matitipid sa produksyon ang pagbabago ng oras. Ang walong pagtakbo ay isang maliit at madaling set.
Ang mga bilang na ito ay isang halimbawang pagtatantya batay sa nakasaad na pagsubok, isang maliit na sample, isang modelo, at isang halo-halong bulwagan. Hindi sila isang PUE, hindi isang megawatt ng kampus, at hindi rin patunay na dapat magtayo ang Kestrel ng isang lugar ng pagsasanay sa isang bukid. Ang pagsusuri sa mga troso ay nasa loob ng 9 na oras; hindi nila ito itinago. Ang bilang na 18 kW ay isang bilugan na pagbasa ng PDU, hindi isang invoice ng utility. Hindi nila kinomberte ang 72 oras sa isang gastos, dahil ang pinaghalong singil sa kuryente ng pabrika ay gagawa ng isang pekeng kaso sa negosyo.
Hiwalay at mas maliit ang serving check: 200 line images papunta sa bakod na kahon, lahat on site. Inference lang 'yan, hindi training. Ang paghahalo ng dalawa ay magiging hybrid-hall mistake sa miniature.
Ano ang maaaring magkamali
-
Patuloy na tinatawag ng procurement ang apat na server na "AI data center". Itinatago ng label ang mga tubo, at ang susunod na pagbili ay mas maraming GPU para sa parehong sick aisle
-
Pumasok ang mga rear-door exchanger at walang nagkomisyon sa water side. Sumisigaw pa rin ang mga bentilador. Bumababa pa rin ang mga orasan
-
Ang tela ay isang switch na walang ekstrang daanan. Isang sirang kawing at ang "cluster" ay apat na workstation na naman
-
Nanatili ang mga checkpoint sa SAN dahil ang NVMe pool ay "phase two". Hindi dumarating ang phase two bago ang susunod na dead node
-
May PUE sila para sa dalawang rack sa isang mixed hall. Ang klima, hangganan, at ang iba pang bahagi ng hanay ng ERP ay ginagawa ang ratio na iyon na isang kasuotan
-
Ang pagsasanay at paghahain ay naghahati sa tela. Ang pagbaha sa checkpoint ay nagpapaantala sa linya ng pabrika. Ang tail latency ay ang produkto doon, hindi ang densidad
-
Namatay ang isang node at may tumuring dito bilang isang uptime ticket sa halip na isang checkpoint restart. Nag-usap nang matagal ang mga enterprise op at AI op nang buong hapon
-
Maaari sana silang umupa ng hawla, ngunit hindi maaaring umalis ang mga imahe. Dahil sa pagkalimot sa limitasyong iyon, napunta sila sa isang cloud conversation, kailangan nilang magrelaks
Praktikal na takeaway
Ano ang isang AI Data Center, sa ganitong anyo, ay hindi isang bodega at hindi rin ito isang invoice ng GPU. Ito ang cell na nagpapahintulot sa mga accelerator na tapusin ang pagtakbo: lakas na kaya nilang hawakan, init na umaalis, isang tela, isang checkpoint, at isang taong may pananagutan kapag namatay ang isang ranggo. Hindi kailangan ng Kestrel ng isang campus. Kailangan nila ng dalawang rack para tumigil sa pagpapanggap. Karamihan sa mga team ay dapat umupa ng ganoong pag-uugali. Ang ilan, na may isang lihim na dataset at isang hall na kayang tiisin ang init, ay dapat gumawa ng isang cell at tumanggi sa slide.
Mga Madalas Itanong
Ano ang isang AI Data Center?
Isang high-density compute site kung saan ang power, cooling, networking, at storage ay nakasentro sa parallel training at model serving, hindi sa maayos na hanay ng mga general-purpose server. Ito ay dinisenyo upang ang napakaraming accelerator ay makapagsanay at makapagserbisyo ng mga modelo nang hindi natutunaw, natigil sa network, o naghihintay sa disk. Ang isang ordinaryong enterprise hall ay isang mixed neighborhood. Ang isang AI hall ay isang monoculture na ang unit of value ay ang accelerator, tulad ng mga GPU o TPU-style chips. Mukha itong bodega at kumikilos na parang isang power station na gumagawa ng matematika.
Paano naiiba ang isang AI data center sa isang normal na data center?
Ino-optimize ng mga tradisyonal na bulwagan ang magkahalong workload at uptime sa maraming maliliit na serbisyo. Binabago ng mga AI site ang mga ratio: tumataas ang density, nagiging parang tela ang network na hindi maaaring mag-aberya kung wala ang training job, at kailangang panatilihing gumagalaw ang mga checkpoint o hindi gumagana ang mga accelerator. Iniisip ng mga enterprise op ang mga ticket at nagpapalit ng mga window. Iniisip ng mga AI op ang mga pila ng trabaho at ang pakiramdam na hindi maganda kapag namatay ang isang node sa kalaunan. Maaari mo pa ring tawagan ang parehong data center. Itinatago lang ng label ang tubo.
Bakit gumagamit ng napakaraming kuryente ang mga AI data center?
Ang namumukod-tanging hardware ay hindi isang matalinong CPU. Ito ay ang accelerator tray: mga GPU o iba pang AI chips, na naka-pack sa mga server, pagkatapos ay mga rack, pagkatapos ay mga hilera na nagbabahagi ng isang high-bandwidth fabric. Ang densidad bawat rack ang plot twist: mas kaunting mga rack, bawat isa ay isang maliit na furnace. Lumilitaw ang mga megawatts ng IT load kapag napuno ang isang hall, bagaman hindi sulit ang pag-imbento ng isang tipikal na numero. Ang naglilimita sa kadahilanan ay kadalasang ang substation, hindi ang wishlist ng mga GPU.
Paano pinapalamig ang mga AI data center?
Ang mga high-density rack ay naglalabas ng init sa paraang hindi talaga hinihiling na hawakan ng hangin. Maaari mong itulak ang hangin nang mas malakas gamit ang mga rear-door heat exchanger, mas mainit na mga aisle, at matalinong pagpigil. Pagkatapos ay lumilitaw ang likido: direktang paglamig sa chip, mga coolant loop, at paglulubog sa ilang mga disenyo. Ang isang accelerator na nagpapabilis ay isa na binayaran mo na at hindi mo lubos na magagamit. Mahalaga pa rin ang PUE dahil ang bawat watt na ginagastos sa mga bentilador at bomba ay isang watt na hindi napupunta sa isang GPU. Ang tubig ay nananatili rin sa kwento: ang ilang mga halaman ay humihigop, ang ilan ay lumulunok.
Bakit kasinghalaga ng mga GPU ang networking?
Ang pagsasanay ay isang pag-uusap: libu-libong accelerator na nagpapalitan ng mga gradient, parameter, at mga piraso ng isang modelo nang mahigpit na naka-sync. Kung ang tela ay nanginginig, ang buong trabaho ay naghihintay sa pinakamabagal na paglukso. Kaya naman ang mga AI hall ay nahuhumaling sa high-bandwidth networking, mababang latency, mga tela na parang InfiniBand o Ethernet sa parehong papel, at mga topolohiya na hindi natitiklop sa kalahati kapag ang isang link ay nabigo. Ang inference ay nagmamalasakit sa tail latency, maraming mas maliliit na kahilingan, at paghihiwalay. Sa gusaling ito, ang tubo ay ang restaurant.
Para saan ginagamit ang isang AI Data Center: pagsasanay o paghihinuha?
Ang pagsasanay ay isang kampanya: bumuo ng isang cluster, pakainin ito ng data, mag-checkpoint nang masinsinan, at patakbuhin nang ilang oras o linggo. Ang hinuha ay isang shopfront: ang mga modelong sinanay na, sumasagot na ngayon, na may latency na mahalaga. Ang mga training campus ay naghahabol ng kuryente, lupain, at densidad. Ang mga inference site ay naghahabol ng latency at presensya. Umiiral ang mga hybrid hall dahil ang kapital ay hindi walang hanggan, minsan ay isang hall na may dalawang cooling loop. Ang isang medyo lumang accelerator na malapit sa customer ay maaaring talunin ang isang kaakit-akit na hall sa isang kontinente ang layo.
Bakit mahalaga ang imbakan sa isang AI data center?
Kailangang dumating nang mabilis ang training data para hindi mag-abala ang mga GPU. Kailangang dumating ang mga checkpoint para hindi masira ang isang linggo kapag may crash. Kailangang mag-load ang mga weight ng modelo bago magamit ang isang replica na ginagamit. Ang throughput ng storage, hindi lang ang kapasidad, ang tahimik na hadlang. Maaari kang gumastos nang malaki sa mga accelerator at pabayaan ang mga ito gamit ang isang magalang na array na idinisenyo para sa mga virtual machine.
Ano ang mangyayari kapag namatay ang isang node sa kalagitnaan ng pagpapatakbo?
Ang isang patay na accelerator sa isang mahigpit na kaugnay na trabaho sa pagsasanay ay maaaring makapagpabagal sa buong koro. Ang pagsasanay ay nangangailangan ng mga checkpoint, hindi optimismo. Ang inference ay nakakaubos ng sick node, nagpapanatili ng isang replica na sumasagot, at nananatiling live. Ang mga window ng pagbabago ay nananatiling bumangga sa mga run ng pagsasanay na walang pakialam sa iyong kalendaryo. Mahalaga pa rin ang redundancy para sa power, cooling, path, at storage, ngunit ang failure mode ay hindi gaanong maayos kumpara sa lumang siyam na uptime slide.
Ano ang epekto ng isang AI Data Center sa grid, tubig, at mga kapitbahay?
Ang koneksyon sa grid ay kadalasang ang tunay na proseso ng pagpili ng lokasyon. Mas madali ang lupa kumpara sa isang substation at isang utility na may ibang mga customer. Ang tubig para sa pagpapalamig, kung gagamitin mo ito, ay nagiging isyu sa kapitbahay sa sandaling malakas ang ulan, kasama ang ingay, visual bulk, at init sa bakod sa hangganan. Ang pagsasanay ay maaaring magtago sa mas murang mga pamilihan ng kuryente at mas malamig na klima. Gusto ng inference na malapit sa mga gumagamit. Walang iisang perpektong lokasyon. May kompromiso sa isang press release.
Kailangan ko bang magmay-ari ng AI data center, o dapat ba akong umupa?
Karamihan sa mga tao ay hindi kailangang magmay-ari ng isa sa mga bulwagan na ito. Gumagawa ng mga hyperscaler dahil ang produkto ay ang fleet. Gumagawa ng mga lab kapag ang oras ng pila ay nasa bottleneck o hindi makaalis ang data. Ang isang bangko, ospital, gobyerno, o tagagawa na may sikretong dataset ay maaaring gawing makatwiran ang on-prem o isang pribadong colo cage. Dapat umarkila ang lahat ng iba: AI-ready colocation, isang cloud reservation, o isang managed cluster. Makukuha mo ang mga accelerator nang hindi nagiging isang operator ng power plant.
Mga Sanggunian
-
IEA - www.iea.org
-
LBNL - datacenters.lbl.gov
-
Ang Green Grid - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
Uptime Institute - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com