Nvidia пусна нова платформа за управление на GPU парка, която има за цел да осигури на операторите на центрове за данни видимост в реално време за разрастващата се AI инфраструктура. Системата извлича телеметрията от глобално разпределените инсталации в облачната платформа NGC на Nvidia, която показва всичко - от състоянието на хардуера и енергийната ефективност до физическото местоположение на работещите в момента графични процесори.
Софтуерът разчита на управляван от клиента агент, инсталиран във всяка среда. Този агент събира подробните данни за системата и ги изпраща към централизирано табло за управление, разположено в NGC платформата. Оттам операторите могат да изследват производителността на няколко нива: глобален изглед на целия разгърнат хардуер, изчислителни зони, съответстващи на отделните локални или облачни сайтове, както и детайлни разбивки възел по възел.
Получените данни не само предоставят справки за инвентара и използването, но могат да определят къде физически работи всеки графичен процесор - функционалност, която може да възпрепятства контрабандата и неразрешения износ на AI процесори с ограничен достъп.
От Nvidia подчертават, че софтуерът е само слой за наблюдение. Той няма възможност да деактивира графичните процесори или да променя поведението им от разстояние - избор на дизайн, целящ да предотврати опасенията за „задни вратички“ или контролирани от производителя превключватели. На практика Nvidia може да види дали нейните чипове се появяват в региони, където не са разрешени, но няма технически механизъм за деактивирането им. Компанията твърди, че платформата е с отворен код, инсталира се и се управлява от клиентите и е напълно одитируема.
Телеметрията в системата също подпомага анализа на работата. Платформата проследява поведението на мощността, включително краткотрайните скокове на натоварването, което позволява на операторите да останат в рамките на бюджетите за консумация на енергия, като същевременно прецизират енергийната ефективност.
Тя също така отчита използването на графичните процесори, пропускателната способност на паметта и производителността на взаимовръзките в клъстерите с няколко възела. Взети заедно, тези сигнали могат да разкрият фините неефективности, като насищане на пропускателната способност или влошени връзки, които могат незабелязано да подкопаят производителността по време на широкомащабни натоварвания при обучение или извеждане на заключения.
Друга основна тема е термичният мениджмънт. Агентът за мониторинг открива концентрацията на топлина и нередностите във въздушния поток, които могат да означават недостатъчно охлаждане при плътните сървърни конфигурации. Ранното откриване на тези топлинни дисбаланси дава възможност за корективни действия, преди да се появи тротлинг, както и остаряване на компонентите - проблеми, които могат да съкратят живота на хардуера и да намалят пропускателната способност в стелажите с интензивно използване на GPU.










Коментари
Моля, регистрирайте се от TУК!
Ако вече имате регистрация, натиснете ТУК!
Няма коментари към тази новина !
Последни коментари