Amazon SageMaker Inference: обзор ключевых обновлений 2026 года

AWS Machine Learning · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

AWS представила 13 новых функций для платформы SageMaker Inference, направленных на ускорение развертывания и оптимизацию производительности генеративных ИИ-моделей. Обновления включают автоматический подбор конфигураций, снижение задержек через кэширование и совместимость с OpenAI API.

Ценность: Эти обновления решают критические проблемы инференса LLM: высокие задержки, сложность масштабирования и нехватку GPU-ресурсов, что позволяет компаниям эффективнее управлять затратами и производительностью ИИ-инфраструктуры.

Инференс генеративных моделей искусственного интеллекта остается одной из самых сложных задач в области облачных вычислений. Модели размером в десятки или сотни гигабайт требуют высокой пропускной способности, а время холодного старта может занимать минуты из-за передачи весов и загрузки контейнеров. Традиционные инструменты мониторинга часто не предоставляют детальных сигналов на уровне токенов, критически важных для работы в продакшене. В ответ на эти вызовы Amazon Web Services представила 13 новых возможностей для платформы SageMaker AI в первой половине 2026 года, охватывающих два основных пути развертывания: управляемые эндпоинты и HyperPod Inference для Kubernetes-нативного управления кластерами GPU.

Для команд, предпочитающих, чтобы AWS занималась инфраструктурой, ключевым нововведением стал инструмент рекомендаций по инференсу. Ранее выбор оптимального типа инстанса и настроек оптимизации требовал двух-трех недель ручного бенчмаркинга сотен комбинаций. Теперь система автоматически сужает пространство поиска, применяет техники вроде спекулятивного декодирования EAGLE 3.0 и проводит строгое тестирование на реальном GPU-оборудовании. Результатом становится готовый к развертыванию пакет модели с валидированными метриками задержки и стоимости, что позволяет, например, удвоить пропускную способность без увеличения латентности.

Проблема дефицита ресурсов решена через пулы инстансов, учитывающие доступность мощностей. Вместо привязки к одному типу инстанса, который может быть недоступен, пользователи задают приоритетный список из пяти вариантов. Система автоматически переключается на доступные ресурсы при создании эндпоинта или масштабировании, а при высвобождении мощностей возвращается к предпочтительному оборудованию. Это устраняет единственную точку отказа и повышает отказоустойчивость сервисов.

Снижение задержек достигнуто также за счет кэширования контейнеров и префикс-осознанной маршрутизации. Кэширование позволяет новым инстансам запускаться с уже загруженным образом, что сократило время старта в демонстрационных тестах на 51%. Префикс-осознанная маршрутизация направляет запросы с общими частями промпта на один и тот же инстанс, максимизируя повторное использование KV-кэша. По данным AWS, это привело к снижению P90 времени до первого токена на 33–37% для длинных контекстов.

Для упрощения миграции SageMaker теперь поддерживает OpenAI-совместимые API. Разработчики могут использовать стандартные SDK и логику стриминга, изменив лишь URL эндпоинта. Аутентификация осуществляется через bearer-токены на основе AWS-учетных данных, что убирает сложность подписи SigV4. Это позволяет агентам ИИ работать на инфраструктуре клиента, используя привычный интерфейс.

В сегменте HyperPod Inference для Kubernetes-кластеров акцент сделан на производительности и комплаенсе. Упрощенный оператор инференса позволяет развертывать модели через одно кастомное ресурсное определение, управляя масштабированием и фолбэком инстансов. Новая функция DPD (Disaggregated Prefill and Decode) разделяет этапы обработки промпта и генерации токенов на разные пулы GPU, что делает задержки более предсказуемыми под смешанной нагрузкой. Также внедрена система захвата данных для создания неизменяемых логов активности, необходимых для регуляторных требований.

Наблюдаемость была значительно улучшена за счет интеграции с OpenTelemetry и готовых дашбордов в CloudWatch Insights. Теперь метрики уровня токенов, состояние KV-кэша и здоровье GPU доступны по умолчанию без дополнительной настройки. Это позволяет командам оперативно выявлять узкие места и анализировать распределение нагрузки между зонами доступности.