Кратък отговор: Центърът за данни с изкуствен интелект е с висока плътност , където захранването, охлаждането, тъканите и съхранението са насочени към обучение и обслужване на модели, а не към сървърна зала с допълнителни графични процесори. Чиповете получават славата; сградата решава дали работят. Ако изображенията не могат да бъдат пренесени, преоборудвайте малка клетка; повечето екипи трябва да наемат.
Ключови изводи:
Чипове срещу изграждане: Захранването, охлаждането, платката и съхранението решават дали ускорителите работят.
Места, а не дворци: Преоборудвайте два стелажа, когато данните не могат да бъдат изнесени; не купувайте кампус.
Средна стойност спрямо медиана: При осем цикъла медианата започва отначало; използвайте 18-часовата средна стойност.
Устойчивост на злоупотреба: Не цитирайте PUE за два стелажа в смесена зала.
Илюстративни резултати: Осем цикъла са малка карта, а не 50% икономия на производство.

Статии, които може да ви харесат след тази:
🔗 Надежден ли е изкуственият интелект? Видео и тест
Разгледайте надеждността на изкуствения интелект чрез ангажиращо видео и интерактивен тест.
🔗 Как да използвате ИИ в ежедневието
Открийте практични начини, по които ИИ може да опрости ежедневните задачи и рутини.
🔗 Как да използвате ИИ на работното място
Научете практични начини за използване на ИИ за по-интелигентна производителност на работното място.
🔗 Може ли изкуственият интелект да мисли самостоятелно?
Разберете дали изкуственият интелект наистина може да мисли самостоятелно или да разсъждава.
Как се различава от „нормален“ център за данни
Традиционните зали се оптимизират за смесени натоварвания и време на работа в рамките на множество малки услуги. Разбира се, вие се интересувате от резервирането, както и от PUE като концепция - допълнителна енергия, която сградата изразходва, за да достави един ват изчислителна мощност. Обикновено не проектирате всеки коридор около стелаж, който се държи като преносима отоплителна ферма.
Сайтовете с изкуствен интелект обръщат съотношенията. Плътността се увеличава. Мрежата се превръща в тъкан, без която обучителната работа не може да се осъществи. Съхранението на данни трябва да поддържа контролните точки в движение или ускорителите да стоят бездействащи, като състезателни коне в задръстване.
Съществува и културна разлика. Корпоративните операции мислят в тикети и прозорци за смяна. Операциите с изкуствен интелект мислят в опашки от задачи и неприятното чувство, когато даден възел спре да работи в дългосрочен план. Предполагам, че все още можете да наречете и двете „центрове за данни“, защото са такива. Етикетът просто скрива водопроводната инсталация.
| Тип | За какво е построен | Отличен хардуер | Характеристики на мощността / охлаждането | На кого подхожда | Защо съществува |
|---|---|---|---|---|---|
| Традиционен корпоративен център за данни | Смесена ИТ среда: бази данни, виртуални машини, имейл, файлове | Процесори, обикновени сървъри, познато съхранение | Водени от въздуха; умерена плътност; PUE като тема за разговор | Компании, които използват ежедневни системи | Поддържайте бизнес приложенията актуални |
| Клъстер за обучение по ИИ | Дълги, тясно свързани обучителни задачи | Плътни ускорителни стелажи; Връзки за графични процесори | Висока плътност; течно охлаждане или [топлообменници със задна врата] (https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Лаборатории и конструктори на модели, живеещи в опашки от работа | Завършете бягането, без да гладувате за чипса |
| Механизъм за изводи с изкуствен интелект | Обслужване на модел; отговори в реално време и пакетни отговори | Ускорители; балансьори на натоварването, които имат значение | Все още е горещо, просто... по-малко театрално; латентност пред груба плътност | Продукти, които трябва да отговорят сега | Поставете модела близо до потребителя |
| Хибридна зала с изкуствен интелект | Обучение и служба под един покрив; ами - нещо като | Смесени стелажи; оградени басейни; споделена материя | Две страхотни личности в едно помещение за растения;; става неловко | Екипи, които не могат да си позволят два кампуса | Капиталът е ограничен; животът е неподреден |
Не е морална класация. Различни машини, едно и също фамилно име.
Графични процесори, ускорители и шкафът, който консумира енергия
Вървете по традиционен повдигнат под и стелажите изглеждат почти учтиво. Вървете по ред с изкуствен интелект и те изглеждат сякаш искат да погълнат сградата.
Отличаващият се хардуер не е умен процесор. Това е ускорителната система: графични процесори или други AI чипове, опаковани в сървъри, след това в стелажи, след това в редове, които споделят високоскоростна мрежа. Графичните процесори свързват чиповете в нещо, което може да се преструва на един гигантски ускорител; клъстерната мрежа прави същия трик в мащаб на редове. Паралелното обучение работи само ако тези връзки останат дебели и предвидими. Загубете това и вашият „клъстер“ ще се превърне в купчина скъпи работни станции, споделящи един пощенски код.
Захранването следва чиповете. Не е тромаво офисно PDU. Мегавати ИТ натоварване, след като една зала се напълни - няма да измислям число. Плътността на шкаф е обратът в сюжета. По-малко шкафове. Всеки един е малка пещ. Ограничаващият фактор често е подстанцията, а не списъкът с желания за графични процесори. Знаете как е: обществените поръчки искат повече ускорители; комуналната компания иска дълъг разговор и много голям чек.
Една леко глупава метафора, от която не мога да се отърва: багажникът е гладно животно. Можеш да отгледаш по-бързо такова. Все пак трябва да го храниш и все пак да поглъщаш жегата. Ако пропуснеш и двете, то се превръща в много скъпо преспапие.
Проблемът с мощността, топлината и охлаждането
Електричество вляво. Отопление вляво. Това е цялата религия.
Стелажите с висока плътност отвеждат топлината по начин, по който въздухът никога не е бил принуден да се справя. Можете да нагнетите въздуха по-силно - топлообменници на задната врата, по-горещи коридори, интелигентно задържане - и това работи до известна степен. Тогава се появява течност:
-
Охлаждащи контури, които правят помещението за инсталации да изглежда като химически завод
-
Потапяне в няколко дизайна, което все още стряска хората, които смятат, че водата и сървърите не трябва да споделят едно изречение
Нищо от това не е бляскаво. Всичко е заради продукта, защото газта, която намалява газта, е такава, за която вече сте платили и не можете да я използвате пълноценно.
PUE все още има значение. Това е съотношение, а не личност. Операторите го преследват, защото всеки ват, изразходван за вентилатори и помпи, е ват, който не е отишъл в графичен процесор. Няма да цитирам „типична“ цифра; климатът и начинът, по който очертавате границата, я променят, а фалшивата прецизност е по-лоша от никаква. Водата също е част от историята. Някои растения отпиват. Други преглъщат. Изпарителното охлаждане е ефективно, докато реката или сушата не го направят политически проблем.
Работа в мрежа: защо тъканта е толкова важна, колкото и чиповете
Хората снимат графичните процесори. Те трябва да снимат и превключвателите.
Обучението е разговор. Хиляди ускорители, които обменят градиенти, параметри, парчета от модел, в тясна синхронност. Ако мрежата (fabric) трепти, цялата работа чака най-бавния хоп. Ето защо залите с изкуствен интелект са обсебени от високоскоростни мрежи, ниска латентност и топологии, които не се сгъват наполовина, когато връзката се повреди. InfiniBand-подобни мрежи, Ethernet в същата роля, GPU връзки вътре в кутията, окабеляване, което трябва да е правилно от първия път.
Изводът е съвсем различен разговор. Обслужването на модела се интересува от латентността на опашката - бавния отговор, а не от средния. Пакетното срещу реалното време разделя личността. Обучителният клъстер иска плътно, колективно движение „всичко към всички“. Обслужващата флотилия иска много по-малки заявки и изолация, без задръстване при балансьора на натоварването.
Пропускът, докато съм тук: хората третират мрежата като водопровод, а чиповете като ресторанта. В тази сграда водопроводът е ресторантът. Ако го пропуснете, ще си купите кухня, която не може да приема доставки.
Обучение срещу извод: две сгради, понякога буквално
Обучението е кампания. Сглобявате клъстер, захранвате го с данни, поставяте му контролни точки редовно, стартирате го с часове или седмици и се молите мрежата да остане безпроблемна. Изискваща големи партиди данни, жадна за честотна лента, тихо и търпеливо - докато повреден възел не отхапе от изпълнението. Един неработещ ускорител в тясно свързана задача може да спре целия хор.
Инференцията е като витрина. Моделите, които вече са обучени, сега отговарят на въпроси, класифицират изображения, генерират текст. Латентността е от значение. Малко по-стар акселератор близо до клиента може да победи бляскав такъв на континент разстояние.
Така се получава разделение. Учебните кампуси преследват мощност, земя и гъстота. Местата за извод преследват латентност и присъствие. Съществуват и хибридни зали, защото капиталът не е безкраен. Е - не винаги две сгради. Понякога една зала с кадифено въже и два охлаждащи контура.
Това е и мястото, където колокацията, хипермащабните кампуси и локалните сгради се разклоняват. Хипермащабните сгради изграждат мащаби, които карат останалите от нас да изглеждат сякаш подреждат мебели. Колокалните сгради продават плътност на стелажи. Локалните сгради все още се случват, когато данните не могат да бъдат изнесени.
Производителност на съхранението, контролни точки и „гладни“ чипове
Никой не слага паралелната файлова система на корицата на брошурата.
Данните за обучение трябва да пристигат достатъчно бързо, за да не се налага графичните процесори да „тропат с крака“. Контролните точки трябва да се установят, така че евентуалният срив да не пропилее седмица. Тежестите на моделите трябва да се заредят, преди обслужващата реплика да е активна. Пропускателната способност на паметта - не само капацитетът - е тихото пречка. Можете да похарчите цяло състояние за ускорители и да ги лишите от ресурси с учтив масив, предназначен за виртуални машини.
Моделът е познат: лъскав клъстер, опашка от задачи и чакане за вход/изход, гледащи назад като груба фактура. Клъстерирането на изчисления без клъстериране на пътя на данните е начинът да се получи много скъпо празен ход. Поддържайте чиповете заредени или си признайте, че сте си купили скулптура.
Софтуер, оркестрация и небляскавият операционен слой
Хардуерът е звездният. Планиращите вършат работата.
Един център за данни с изкуствен интелект е безполезен, ако задачите не могат да намерят графични процесори, ако два екипа не могат да споделят клъстер без бой, ако неуспешен ранг не може да бъде заменен, ако фърмуерът се променя, докато структурата се повреди на забавен каданс. Оркестрация, наблюдаемост, ограничаване на мощността - небляскавият операционен слой, по който знаете, че има значение.
Имам слабост към този слой. Също така, когато неправилно конфигурирана мрежова карта се представя за проблем с охлаждането в продължение на цял следобед... разбираш го по трудния начин.
Когато възел умре по време на изпълнение
Възелът умира. Прозорците за промяна все още се сблъскват с обучителни изпълнения, които не се интересуват от вашия календар. Планирате групово големи задачи, ограждате пулове за извод, пишете наръчници за повреди, които изглеждат като „задачата е бавна“, докато не започнат да изглеждат като „задачата е мъртва“. Резервирането все още има значение - захранване, охлаждане, пътища, съхранение - но режимът на отказ е по-малко подреден от стария слайд с деветки от времето на работа. Извод: реплика, източете болния възел, продължете да отговаряте. Обучението иска контролни точки, а не оптимизъм.
Местоположение, вода, електропреносна мрежа и съседи
Не пускаш едно от тях до вила заради гледката.
Присъединяването към мрежата често е истинският процес на избор на място. Земята е лесна в сравнение с подстанция и комунално предприятие, което има други клиенти. Водата за охлаждане, ако я използвате, се превръща в проблем за съседите веднага щом валежите станат груби. Шум. Визуално обемно пространство. Топлина на граничната ограда. Комисиите по планиране откриват мнения за „облака“ в момента, в който той се нуждае от поле и река.
Латентността дърпа в обратната посока. Инференцията обича да е близо до потребители и взаимовръзки. Обучението може да се скрие в по-евтини пазари на енергия и по-хладен климат. Индустрията говори така, сякаш има едно перфектно място. Няма такова. Има компромис с прессъобщение.
Остатъчната топлина и неканената пещ
Брошурите обожават това. Да се отвежда отпадната топлина в домове, басейни, оранжерии; това е прекрасно изречение. Понякога районният цикъл е истински. Понякога кампусът е на грешното място и топлината все пак отива във въздуха. Скептичен съм към версията в брошурата; не съм скептичен към физиката.
Кой има нужда от такъв (и кой би трябвало да наеме вместо това)
Повечето хора не е необходимо да притежават една от тези зали.
Краткият списък:
-
Хиперскалери, защото продуктът е флотът
-
Лаборатории, когато времето на опашката е пречка или данните не могат да напуснат
-
Банка, болнична група, правителство или производител със секретен набор от данни - локален или частен колокадж, може да бъде рационално, дори и да е фалшиво
Всички останали трябва да наемат. Колокация с плътност, готова за изкуствен интелект. Резервация в облак. Управляван клъстер. Получавате ускорителите, без да ставате и оператор на електроцентрала. Романтиката избледнява първия път, когато някой попита кой е на разположение за охлаждащата система в 3 сутринта.
Ще призная, че има нещо като гордост. Да притежаваш клъстера се усеща като да притежаваш средствата за прогнозиране. После пристига фактурата за електричество и гордостта утихва.
За какво е сградата
И така, какво е център за данни с изкуствен интелект? Специализиран кампус с висока плътност, където ускорители, захранване, охлаждане, платка и съхранение са организирани около модели за обучение и обслужване - не е универсална ИТ система с графичен процесор в ъгъла. Прилича на склад. Държи се като електроцентрала, която прави математически изчисления.
Ако не си спомняте нищо друго: чиповете получават славата; подстанцията, охлаждащата течност и мрежата решават дали тези чипове са били добра идея. Обучението и изводите могат да споделят един покрив; те все още искат различни маниери. Повечето организации трябва да наемат. Някои трябва да строят. Съседите ще забележат и в двата случая.
Облакът винаги е имал сграда. В днешно време сградата има мнения.
Пример от реалния свят: Тренировъчна клетка с два стелажа, когато изображенията не могат да напуснат
Сценарий
Томос е ръководител на инфраструктурата в Kestrel Precision, производител с 400 служители в Уест Мидландс. Те вече имат малка локална зала: ERP, споделяне на файлове, виртуални машини, смесеният квартал, с който започна тази статия. Въздушно охлаждане. Обикновен Ethernet. SAN, която е идеална за офис дискове.
Екипът за машинно зрение трябва да обучи модел за инспекция върху фабрични снимки. Снимките не могат да напуснат обекта. Те показват процес, който компанията няма да качи на облачен диск, дори на частен. Решението на отдела за обществени поръчки е четири сървъра с два ускорителя и слайд, озаглавен „нашият център за данни с изкуствен интелект“. Сървърите се поставят в два съществуващи стелажа, защото има място, а пространството се усещаше като ограничение.
Не е така. В рамките на две седмици графичните процесори започват да звучат заети и след това тихо да се забавят. Задачите се забавят, когато контролна точка достигне SAN. Възел умира в единадесет часа и работата просто... изчезва. Томос не е пропуснал да купи чипове. Той е купил куп скъпи работни станции, споделящи един пощенски код. Сградата все още е била корпоративна зала.
Те не се нуждаят от кампус, нова подстанция или река. Нуждаят се от малка клетка, която се държи като миниатюрен център за данни с изкуствен интелект: мощност, която стелажите могат реално да поберат, топлина, която излиза, без да готви чиповете, материя, през която може да се разпределя обучителната задача, съхранение, което може да поеме контролна точка, и наръчник с инструкции за случаите, когато възел спре да работи. Тъй като изображенията не могат да излизат, наемането на колокейдж на четиридесет минути разстояние не е решението. Преоборудването с два стелажа е решението.
От какво се нуждае клетката
-
Измерен енергиен бюджет на този ред, от PDU, а не от списъка с желания за GPU. Ако свободният капацитет не може да захрани четирите сървъра при тренировъчно натоварване, разговорът спира дотук и те разглеждат по-плътна колорадска среда, а не чудо
-
Охлаждането на въздуха никога не е било изисквано да се обработва при тази плътност: топлообменници на задната врата, ако залата може да ги поеме, или малък течен контур, ако може да поеме и това. Ако нито едното, сървърите не се поставят
-
Специализирана високоскоростна мрежа между четирите възела, а не офис Ethernet. Ако доставчикът има само 10 Gb комутатор в каталога, това не е клъстер
-
Локално бързо съхранение за контролни точки и тренировъчни шардове, а не за VM SAN
-
Планировчик, интервал на контролни точки и писмен път за рестартиране. Хардуерът е звездният. Този слой е задачата
-
Оградена кутия за извод за фабричната линия, отделна от обучителния чат, защото обслужването изисква латентност на опашката и изолация, а не колективно
-
Разрешение за регистриране на захранване, тактови часовници на графичния процесор, събития на дросела и стенен часовник на задачата. Ако не могат да ги проверят, ще снимат графичните процесори и ще пропуснат превключвателите
Примерна инструкция
Томос описва това в описанието на съоръженията, на обикновен език:
Не наричайте това кампус с изкуствен интелект. Изградете двустелажна тренировъчна клетка в съществуващата зала за четири сървъра с два ускорителя. Фабричните образи остават на място. Успехът е: четирите възела завършват 12-епохална рецепта за инспекция и обучение без термично регулиране, пишат контролна точка за минути, а не за десетки минути, и възобновяват от тази контролна точка, когато нарочно убием ранг. Охлаждането трябва да поддържа графичните процесори на техните тренировъчни тактови честоти. Мрежата трябва да е структура, която тези четири кутии споделят, а не път през офисния стек. Съхранението трябва да захранва чиповете. Ако топлообменниците на задната врата не пасват, кажете го и спрете. Не цитирайте PUE за два стелажа в смесена зала. Това число би било театър.
След това той поставя това в самата задача за обучение:
Контролен пункт на всеки 30 минути до местния бърз пул. Ако някой от играчите умре, започнете отново от последния пълен контролен пункт. Не чакайте на SAN. Не продължавайте тренировката, докато часовниците са паднали от разгара на тренировката. Запишете го и спрете, за да можем да видим бараката.
Един добър час изглежда така: всичките осем графични процесора са на тренировъчни тактови честоти, файлът с контролни точки е зареден, задачата все още е в синхрон. Един лош час изглежда така: вентилаторите са на пълна мощност, тактови честоти са ниски, контролна точка 2% е записана след десет минути и някой в офиса казва „клъстерът е включен“. Включеният час не е тренировка.
Как да го тествам
Те пишат теста преди обновяването, което е целият смисъл да не се доверяват на демо версия.
-
Същата рецепта от 12 епохи, същите 120 000 инспекционни снимки, осем цикъла
-
Времето е стенен часовник за завършена рецепта, включително всяко рестартиране, измерено от подаването на задачата до последната контролна точка на епоха 12
-
Пропуск при прегряване: Тактовите честоти на графичния процесор остават на целевата стойност за обучение по време на изпълнението. Събитие с дроселиране се счита за неуспешно, дори ако задачата в крайна сметка приключи
-
Пропуск за съхранение: време за запис в контролна точка, медиана и най-лошо, от дневника на заданието
-
Пропуск по отношение на тъканта: работата не стои в колективно чакане, докато даден ранг е здрав. Ако не могат да видят това чакане, инструментацията не е завършена
-
Две от осемте бягания получават ранг, убит на фиксирана стъпка, нарочно, за да се тества пътят за рестартиране
-
Изводът е отделен тест с 200 изображения от фабричната линия до оградената кутия за сервиране. Успехът в обучението не се брои за успех в сервирането
-
Те записват мощността на стелажа от PDU в 15-минутни семпли, така че никой не трябва да измисля мегават
Приемане за назоваване на клетката „AI-ready“: 8 от 8 рецепти са завършени; 0 от 8 показват термична дроселова клапа; и двата аварийни цикъла са възобновени; контролните точки остават след минути. Ако пропуснат това, все още имат сървърна стая с модерни графични карти.
Резултат
Илюстративен резултат от измислен осемкратен тест, а не публикувана фигура за Kestrel.
Предположения: четири сървъра с два ускорителя в два стелажа; един модел за инспекция; 120 000 снимки; осем изпълнения на фиксирана 12-епохална рецепта; стенният часовник включва рестартирания, докато рецептата не завърши; дроселирането означава регистрирано отпадане на тренировъчния часовник; времето за контролна точка е времето за запис, а не желанието; захранването на стелажа е PDU семпли, а не PUE на кампуса.
Преди модернизацията, графичните процесори в обикновени въздушно охлаждани шкафове в офисната Ethernet мрежа и VM SAN:
-
5 от 8 бягания завършиха от първия опит. Средно време на стената сред тези пет: 14 часа
-
3 от 8 опита трябваше да започнат отново след блокиране около 11-ия час (два след като възел спря със застояла контролна точка, един след като контролна точка запълни SAN). Незабавен повторен опит, без чакане през нощта: 11 загубени часа плюс 14-часов втори опит или 25 часа до завършена рецепта на тези три
-
Средно време до завършване на рецепта за всичките осем, включително рестартиранията: 18 часа. (Пет на 14, три на 25. Медианата на всичките осем все още е 14, което би скрило рестартиранията. Ето защо средната стойност е базовата стойност тук.)
-
Термична дроселова клапа е регистрирана при 7 от 8 пускания. Средно време при намален тактов режим: 3 часа при 14-часов опит
-
Контролна точка за запис: средно 22 минути
-
Убийството по ранг не беше тест, който можеха да преминат. Нямаха наръчник с инструкции. Двете случайни смъртни случаи бяха откритието
-
Пиково ИТ натоварване на двата стелажа по време на тренировка: около 18 kW. Редът имаше достатъчно ватове. Нямаше охлаждане или плат
След топлообменници на задната врата на тези два стелажа, специална мрежа между четирите възела, малък NVMe пул за контролни точки, 30-минутни контролни точки и наръчник за рестартиране:
-
8 от 8 завършиха от първия опит. Средно време на стенен часовник: 9 часа
-
Термична дроселова клапа: 0 от 8
-
Контролна точка за писане: средно 90 секунди. Най-лошо време в серията: 3 минути
-
Двете умишлени убийства на ранг бяха възобновени от последния 30-минутен контролен пункт. Допълнително време за тези две бягания: около 40 минути всяко, включително диагнозата, така че и двете прекараха близо 9 часа и 40 минути. Средно за осем рунда на неподвижни позиции е 9 часа
-
Пиковото ИТ натоварване е все още около 18 kW. Същите чипове. Различно поведение на сградата
В тази извадка средното време до завършване на рецепта е спаднало от 18 часа на 9 часа, или по 9 часа всяка, 72 часа за осем цикъла. Завършените от първи път са се увеличили от 5 от 8 на 8 от 8. Throttle е намалял от 7 от 8 на 0 от 8. Последното число е това, което показва дали са закупили ускорители или преспапие. Те няма да нарекат промяната във времето 50% икономия в производството. Осем цикъла са малък и лесен набор.
Тези цифри са примерна оценка, базирана на посочения тест, малка извадка, един модел и една смесена зала. Те не са PUE, не са мегават на кампуса и не са доказателство, че Kestrel трябва да построи учебен обект на поле. Прегледът на дневниците се проведе в рамките на 9 часа; те не го скриха. Цифрата от 18 kW е закръглено отчитане на PDU, а не фактура за комунални услуги. Те не превърнаха 72-те часа в разход, защото смесената тарифа за електроенергия на фабриката би създала фалшив бизнес случай.
Проверката за сервиране беше отделна и по-малка: 200 линейни изображения към оградената кутия, всички на място. Това е извод, а не обучение. Смесването на двете би било грешката на хибридната зала в миниатюра.
Какво може да се обърка
-
Отделът за обществени поръчки непрекъснато нарича четири сървъра „център за данни с изкуствен интелект“. Етикетът крие водопроводната инсталация, а следващата покупка са още графични процесори за същия „болен коридор“
-
Топлообменниците на задната врата се пускат, но никой не пуска в експлоатация водната страна. Вентилаторите все още крещят. Часовниците все още отмерват времето
-
Структурата е един комутатор без резервен път. Една повредена връзка и „клъстерът“ отново е от четири работни станции
-
Контролните точки остават в SAN, защото NVMe пулът е бил във „фаза две“. Фаза две не пристига преди следващия неработещ възел
-
Те цитират PUE за два стелажа в смесена зала. Климатът, границите и останалата част от ERP реда правят това съотношение костюм
-
Обучението и обслужването споделят тъканта. Наводнението от контролно-пропускателни пунктове кара фабричната линия да чака. Латентността на опашката е продуктът там, а не плътността
-
Възел умира и някой го третира като билет за работоспособност, вместо като рестартиране на контролна точка. Корпоративните оператори и операторите с изкуствен интелект си говорят един през друг цял следобед
-
Можеха да наемат клетка, само че образите не могат да излязат. Забравянето на това ограничение ги изпраща в разговор в облака, който ще трябва да отпуснат
Практично извлечение
Това, което е център за данни с изкуствен интелект в тази си форма, не е склад, нито пък е фактура за графичен процесор. Това е клетката, която позволява на ускорителите да завършат работата си: мощност, която могат да задържат, топлина, която излиза, платка, контролна точка и някой, който ще бъде отговорен, когато даден ранг умре. Kestrel нямаше нужда от кампус. Имаха нужда от два стелажа, за да спрат да се преструват. Повечето екипи трябва да наемат това поведение. Някои, със секретен набор от данни и зала, която може да поеме топлината, трябва да построят клетка и да откажат пързалката.
ЧЗВ
Какво е център за данни с изкуствен интелект?
Изчислителен обект с висока плътност, където захранването, охлаждането, работата в мрежа и съхранението са насочени към паралелно обучение и обслужване на модели, а не към подредени редици от сървъри с общо предназначение. Проектиран е така, че огромен брой ускорители да могат да обучават и обслужват модели, без да се „топят“, да се застояват в мрежата или да чакат на диска. Обикновената корпоративна зала е смесен квартал. Залата с изкуствен интелект е монокултура, чиято единица стойност е ускорителят, като например графични процесори или чипове тип TPU. Прилича на склад и се държи като електроцентрала, която прави математически изчисления.
По какво се различава един център за данни с изкуствен интелект от обикновения център за данни?
Традиционните центрове за данни се оптимизират за смесени натоварвания и време на работа в множество малки услуги. Сайтовете с изкуствен интелект обръщат съотношенията: плътността се увеличава, мрежата се превръща в тъкан, без която обучителната задача не може да функционира, а съхранението на данни трябва да поддържа контролните точки в движение или ускорителите да стоят бездействащи. Корпоративните операции мислят в заявки и прозорци за промяна. Операциите с изкуствен интелект мислят в опашки от задачи и неприятното чувство, когато даден възел спре да работи късно в дългосрочен план. Все още можете да се обадите и на двата центъра за данни. Етикетът просто скрива водопроводната инсталация.
Защо центровете за данни с изкуствен интелект използват толкова много енергия?
Отличаващият се хардуер не е умен процесор. Това е ускорителната тава: графични процесори или други AI чипове, опаковани в сървъри, след това стелажи, накрая редове, които споделят високоскоростна мрежа. Плътността на стелаж е обратът в сюжета: по-малко стелажи, всеки от които е малка пещ. Мегаватите ИТ натоварване се появяват, след като залата се запълни, въпреки че не си струва да се измисля типична цифра. Ограничаващият фактор често е подстанцията, а не списъкът с желания за графични процесори.
Как се охлаждат центровете за данни с изкуствен интелект?
Раковете с висока плътност отвеждат топлина по начин, с който въздухът никога не е бил принуден да се справя. Можете да нагнетите въздуха по-силно с топлообменници със задна врата, по-горещи коридори и интелигентно ограничаване на натоварването. След това се появява течността: директно охлаждане към чипа, охлаждащи контури и потапяне в някои дизайни. Ускорител, който дроселира, е такъв, за който вече сте платили и не можете да го използвате напълно. PUE все още има значение, защото всеки ват, изразходван за вентилатори и помпи, е ват, който не е отишъл в графичния процесор. Водата също е част от историята: някои инсталации отпиват, други глътват.
Защо мрежовото взаимодействие е толкова важно, колкото и графичните процесори?
Обучението е разговор: хиляди ускорители, които обменят градиенти, параметри и фрагменти от модел в тясна синхронност. Ако fabric трепти, цялата работа чака най-бавния хоп. Ето защо залите с изкуствен интелект са обсебени от високоскоростни мрежи, ниска латентност, fabrics като InfiniBand или Ethernet в една и съща роля и топологии, които не се сгъват наполовина, когато връзката се повреди. Инференцията се грижи за латентността на опашката, многото по-малки заявки и изолацията. В тази сграда водопроводът е ресторантът.
За какво се използва център за данни с изкуствен интелект: за обучение или за извод?
Обучението е кампания: сглобете клъстер, заредете го с данни, проверете редовно и работете с часове или седмици. Инференцията е витрина: модели, които вече са обучени, сега отговарят, с латентност, която е от значение. Учебните кампуси се стремят към мощност, земя и плътност. Местата за логически изводи се стремят към латентност и присъствие. Хибридните зали съществуват, защото капиталът не е безкраен, понякога една зала с два охладителни контура. Малко по-стар ускорител близо до клиента може да победи бляскав такъв на континент разстояние.
Защо съхранението е важно в център за данни с изкуствен интелект?
Данните за обучение трябва да пристигат достатъчно бързо, за да не се налага графичните процесори да „тропат с крака“. Контролните точки трябва да се установят, така че евентуалният срив да не пропилее седмица. Тежестите на моделите трябва да се заредят, преди обслужващата реплика да е активна. Пропускателната способност на съхранението, не само капацитетът, е тихото пречка. Можете да похарчите цяло състояние за ускорители и да ги лишите от „гладуване“ с „учтив“ масив, предназначен за виртуални машини.
Какво се случва, когато даден възел умре по време на изпълнение?
Един неработещ ускорител в тясно свързана задача за обучение може да спре целия хор. Обучението се нуждае от контролни точки, а не от оптимизъм. Изводът изтощава болния възел, поддържа отговор от реплика и остава активен. Прозорците за промяна все още се сблъскват с обучителни изпълнения, които не се интересуват от вашия календар. Резервирането все още е важно за захранване, охлаждане, пътища и съхранение, но режимът на отказ е по-малко подреден от стария слайд с деветки от времето на работа.
Какво е въздействието на един център за данни с изкуствен интелект върху мрежата, водата и съседите?
Присъединяването към мрежата често е истинският процес на избор на място. Земята е лесна в сравнение с подстанция и комунално предприятие, което има други клиенти. Водата за охлаждане, ако я използвате, се превръща в проблем със съседите веднага щом валежите станат груби, заедно с шума, визуалния обем и топлината на граничната ограда. Обучението може да се скрие в по-евтини пазари на енергия и по-хладен климат. Инференцията обича да е близо до потребителите. Няма едно идеално място. Има компромис с прессъобщение.
Трябва ли да притежавам център за данни с изкуствен интелект или е по-добре да го наема?
Повечето хора не е необходимо да притежават една от тези зали. Хиперскалерите строят, защото продуктът е флотилията. Лабораториите строят, когато времето на опашката е пречка или данните не могат да бъдат изпратени. Банка, болница, правителство или производител със секретен набор от данни може да направи рационална локалната или частна колокация. Всички останали трябва да наемат: колокация, готова за ИИ, резервация в облак или управляван клъстер. Получавате ускорителите, без да ставате оператор на електроцентрала.
Референции
-
МАЕ - www.iea.org
-
LBNL - datacenters.lbl.gov
-
Зелената мрежа - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
Институт за ъптайм - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com