NVIDIA Vera Rubin NVL72 демонстрирует лидерство в производительности MLPerf Inference v6.1

NVIDIA AI · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Система NVIDIA Vera Rubin NVL72 показала до 3,7-кратного превосходства по пропускной способности над предшественником GB300 NVL72 в дебютных тестах MLPerf Inference v6.1. Компания также подтвердила высокую эффективность масштабирования и непрерывный рост производительности за счет оптимизации программного обеспечения.

Ценность: Результаты демонстрируют, как аппаратно-программная ко-дизайн-стратегия NVIDIA позволяет снизить стоимость генерации токенов и повысить эффективность инфраструктуры для задач AI-инференса, что критически важно для экономики масштабных LLM-приложений.

Экономика инференса в сфере искусственного интеллекта определяется тремя ключевыми факторами: производительностью системы, эффективностью масштабирования инфраструктуры и скоростью оптимизации программного обеспечения. NVIDIA представила результаты дебютного участия платформы Vera Rubin NVL72 в бенчмарке MLPerf Inference v6.1, подчеркнув, что эти параметры напрямую влияют на количество генерируемых токенов и итоговую доходность от инфраструктуры. Компания утверждает, что их платформа спроектирована для оптимизации всех этих аспектов, обеспечивая высокую утилизацию ресурсов при работе с различными моделями и типами задач.

В своем первом превью-представлении Vera Rubin NVL72 продемонстрировала до 3,7-кратного превосходства по пропускной способности над системой GB300 NVL72 на тесте Qwen3-VL в сценариях офлайн, серверного и интерактивного инференса. Эти результаты были получены с использованием фреймворка vLLM и открытого источника NVIDIA Dynamo. На бенчмарке DeepSeek-R1, где применялась библиотека TensorRT-LLM, производительность Vera Rubin NVL72 оказалась до 2,5 раз выше, чем у GB300 NVL72. NVIDIA отмечает, что такие показатели позволяют одному стеллажу Vera Rubin обслуживать больше пользователей и генерировать больше дохода при снижении стоимости за токен.

Достижение этих результатов стало возможным благодаря полному ко-дизайну аппаратного и программного обеспечения. Улучшенные Tensor Cores и Transformer Engine в Vera Rubin ускоряют как этап префилла, так и декодирования. Использование точности NVFP4 снижает потребление памяти для весов модели, внимания и KV-кэша, что позволяет увеличить пропускную способность с минимальной потерей качества вывода. Кроме того, подача данных от NVIDIA активно использовала дисагрегированное обслуживание, разделяя этапы префилла и декодирования, а также применяла крупномасштабный параллелизм экспертов для эффективной работы со слоями mixture-of-experts.

Критически важным аспектом является эффективность масштабирования. NVIDIA показала, что система GB300 NVL72 масштабируется с высокой эффективностью: при увеличении количества GPU с 72 (один стеллаж) до 288 (четыре стеллажа) пропускная способность выросла почти пропорционально, достигнув 99% эффективности масштабирования в офлайн-сценарии DeepSeek-R1. Компания подчеркивает, что простое добавление GPU не всегда приводит к линейному росту производительности, и только синхронное масштабирование архитектуры, межсоединений и программного обеспечения обеспечивает рентабельность инвестиций.

Прогресс также обеспечивается непрерывной оптимизацией ПО. В версии v6.1 производительность GB300 NVL72 на Qwen3-VL улучшилась до 1,6 раза по сравнению с v6.0 благодаря снижению точности KV-кэша, дополнительному слиянию ядер и улучшению дисагрегированного обслуживания. NVIDIA сообщает, что оптимизации продолжались и после дедлайна подачи результатов v6.1, что привело к дальнейшему росту производительности на моделях GPT-OSS-120B и DLRMv3, хотя эти данные еще не верифицированы MLCommons.

Платформа NVIDIA также адаптируется к новым форматам задач, таким как агентный инференс. В превью-тестах на бенчмарке SemiAnalysis AgentX Vera Rubin NVL72 показала 30-кратное превосходство над GB300 NVL72. В будущем стандарт MLPerf Endpoints планирует включить измерение именно таких агентных нагрузок, выходя за рамки традиционных метрик пропускной способности. Экосистема партнеров NVIDIA, включая Nebius, также представила результаты Vera Rubin NVL72, подтвердив широкую поддержку платформы.

Помимо крупных систем, NVIDIA представила результаты Jetson AGX Thor на новом бенчмарке Edge-Agentic с моделью Qwen3.6-27B, демонстрируя охват полного спектра устройств от компактных edge-устройств до крупнейших AI-фабрик. В общей сложности 19 партнеров, включая ASUS, Azure, Cisco и Dell Technologies, участвовали в тестах, восемь из них — на многоузловых системах Blackwell NVL72. Источник: web:NVIDIA AI — https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/