AMD и Cerebras анонсировали гибридную платформу для сверхбыстрого ИИ-инференса
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компании AMD и Cerebras объявили о техническом партнерстве, объединяющем высокопроизводительные GPU-системы AMD Helios с чипом Wafer-Scale Engine для создания раздельного конвейера инференса. Совместное решение, ориентированное на минимальную задержку и высокую пропускную способность, станет доступно через Cerebras Cloud во второй половине 2026 года.
Ценность: Партнерство демонстрирует новый подход к инфраструктуре ИИ: вместо универсальных систем компании предлагают специализированное разделение задач между процессорами, что критически важно для развития агентных приложений и реального времени.
23 июля 2026 года AMD и Cerebras Systems официально представили техническое партнерство, направленное на создание инфраструктуры для искусственного интеллекта с экстремально низкой задержкой. Анонс был сделан в рамках конференции Advancing AI 2026. Ключевой особенностью совместного решения является концепция «disaggregated inference» (раздельный инференс), при которой различные этапы обработки данных выполняются на специализированных аппаратных платформах, работающих как единый конвейер.
В основе архитектуры лежит комбинация двух технологий: стоечных решений AMD Helios и чипа Cerebras Wafer-Scale Engine (WSE). Согласно заявлениям компаний, AMD Helios выступает в роли высокопроизводительного движка пропускной способности, обрабатывая входные запросы (промпты) и большие контекстные окна. В свою очередь, WSE от Cerebras оптимизирован для ускорения генерации токенов и декодирования, обеспечивая сверхбыстрый отклик. Такое разделение позволяет каждой платформе работать в своей зоне максимальной эффективности.
Линда Су, председатель совета директоров и генеральный директор AMD, отметила, что разнообразие задач в сфере ИИ требует более гибкого подхода к инфраструктуре. По ее словам, совместная работа с Cerebras расширяет возможности AMD в сегменте приложений, чувствительных к задержкам, создавая мощную платформу для агентного ИИ в реальном времени. Эндрю Фельдман, сооснователь и CEO Cerebras, подчеркнул, что спрос на сверхбыстрый инференс растет беспрецедентными темпами, а партнерство с AMD дает возможность предоставить эту производительность более широкому кругу клиентов.
Компании указывают, что совокупная система способна обеспечить до пятикратного увеличения показателя токенов в секунду на ватт (T/s/W) по сравнению с конфигурацией, использующей только WSE. Эти данные основаны на моделировании, проведенном лабораториями производительности AMD и Cerebras в июле 2026 года с использованием модели Kimi 2.6 1T. Важно отметить, что фактические результаты могут варьироваться в зависимости от конфигурации систем, устанавливаемых производителями.
Рынок инференса сталкивается с растущим разнообразием требований: высоконагруженные задачи требуют максимизации количества генерируемых токенов, тогда как кодинг, живые агенты и робототехника критически зависят от скорости ответа. Раздельная архитектура позволяет удовлетворить оба этих требования одновременно, не жертвуя масштабируемостью. AMD Helios обеспечивает необходимую масштабируемость для обработки большого числа сложных запросов, а WSE гарантирует возврат токенов в реальном времени.
С точки зрения внедрения, Cerebras планирует развернуть системы AMD Helios в своих собственных дата-центрах. Совместное решение первоначально станет доступно пользователям через облачную платформу Cerebras Cloud во второй половине 2026 года. Этот шаг свидетельствует о том, что индустрия переходит от монолитных решений к гетерогенным инфраструктурам, где выбор вычислительной технологии строго соответствует специфике конкретной рабочей нагрузки.