NVIDIA на ИИ Infra Summit: фокус на энергоэффективности и метрике токенов на ватт

NVIDIA AI · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

На конференции AI Infra Summit компания NVIDIA представила новые результаты по оптимизации энергопотребления для «фабрик ИИ», подчеркнув сдвиг приоритетов от пиковой производительности к валидированной эффективности. Партнеры, включая Lambda и Emerald AI, продемонстрировали значительное увеличение пропускной способности при сохранении или снижении энергетических бюджетов.

Ценность: Материал иллюстрирует фундаментальный сдвиг в архитектуре ИИ-инфраструктуры: от гонки за пиковой мощностью к оптимизации стоимости и эффективности генерации токенов. Это критически важно для понимания экономических моделей развертывания агентных систем и управления энергетическими сетями.

На конференции AI Infra Summit, прошедшей в Санта-Кларе, вице-президент NVIDIA по гипермасштабным вычислениям Иэн Бакк заявил о смене ключевой метрики для индустрии. По его словам, фокус смещается с пиковой производительности на валидированные токены на мегаватт, что требует пересмотра подходов к проектированию «фабрик ИИ» от уровня кремния до энергосетей. NVIDIA позиционирует свою экосистему как полный стек решений, включающий системы Vera Rubin, программное обеспечение Dynamo и сетевые технологии, направленные на максимизацию ценности каждого киловатта потребленной энергии.

Значительное внимание было уделено работе с энергетическими сетями. Партнер NVIDIA, компания Emerald AI, совместно с Silicon Valley Power продемонстрировала программу гибкой нагрузки. Система автоматически реагировала на сотни сигналов от энергосети, снижая нагрузку на низкоприоритетные задачи ИИ в периоды пикового спроса и возвращаясь к нормальной работе при стабилизации. Это позволяет «фабрикам ИИ» функционировать как гибкие ресурсы сети, защищая критически важные вычисления и способствуя общей устойчивости энергоснабжения.

Практические результаты оптимизации энергопотребления представила облачная платформа Lambda. Используя технологию NVIDIA DSX MaxLPS на серверах Blackwell, компания смогла разместить 19 узлов в пределах энергетического бюджета, обычно отведенного для 16 узлов. Это привело к увеличению общей пропускной способности кластера на 24% и повышению производительности на ватт на 23%. NVIDIA отмечает, что для будущих систем Vera Rubin NVL72 аналогичные методы могут обеспечить до 40% больше GPU-мощностей в том же энергетическом бюджете.

Для задач агентного ИИ, требующих низкой задержки и длинного контекста, NVIDIA представила комбинацию Vera Rubin NVL72 и Groq 3 LPX. Эта связка обеспечивает детерминированную сверхнизкую задержку вывода. По данным компании, такая конфигурация способна генерировать до 35 раз больше токенов на мегаватт по сравнению с платформой GB200 NVL72 при работе с моделями, содержащими более 2 триллионов параметров. Это позволяет агентам выполнять большее количество шагов рассуждений и вызовов инструментов в пределах одного бюджета ответа.

Независимые тесты подтверждают эти тенденции. Аналитическая фирма SemiAnalysis на своей платформе AgentX зафиксировала, что Vera Rubin NVL72 обеспечивает до 30-кратного увеличения пропускной способности на мегаватт по сравнению с GB300 NVL72 при работе с моделью DeepSeek V4 Pro. Это также транслируется в экономику: стоимость за миллион токенов снижается до 45 раз, что критически важно для коммерческой жизнеспособности агентных приложений.

Отдельного внимания заслуживают результаты работы процессоров NVIDIA Vera CPU, которые тестируются стартапами для выполнения агентных задач. Perplexity сообщает об ускорении запуска песочниц в 1,9 раза, а Redpanda фиксирует снижение задержек на 5,5 раз и рост пропускной способности на 73% по сравнению с другими процессорами. ClickHouse также отмечает, что Vera CPU показала наилучшие результаты в их бенчмарках аналитических баз данных, что свидетельствует о высокой эффективности для ресурсоемких вычислений.

Наконец, NVIDIA представила шестое поколение NVLink, которое решает проблемы надежности при масштабировании до сотен тысяч GPU. Новая архитектура включает многослойную систему отказоустойчивости: на физическом уровне используются методы коррекции ошибок и восстановления, а на сетевом — динамическое маршрутизирование и балансировка нагрузки. Это позволяет локализовать сбои и предотвращать каскадные остановки, сохраняя непрерывность работы критически важных задач обучения и вывода.