AWS представила SageMaker HyperPod Inference Gateway для оптимизации работы с LLM
AWS Machine Learning · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Amazon Web Services анонсировала новый компонент для Kubernetes, который использует данные о загрузке GPU для маршрутизации запросов к языковым моделям. По заявлению компании, это позволяет снизить задержку первого токена до 82% без изменения клиентского кода.
Ценность: Инструмент решает проблему неэффективного использования дорогостоящих вычислительных ресурсов при обслуживании больших языковых моделей, предлагая нативное для Kubernetes решение с поддержкой мульти-модельной маршрутизации и адаптеров LoRA.
Обслуживание больших языковых моделей (LLM) на GPU-кластерах сопряжено с высокими затратами, которые часто усугубляются неэффективной работой стандартных балансировщиков нагрузки Kubernetes. Алгоритмы round-robin и least-connections не учитывают внутреннее состояние графических процессоров: они не видят заполненность кэшей KV, текущие задачи генерации или наличие загруженных адаптеров LoRA в памяти. В результате запросы накапливаются на перегруженных подах, а свободные мощности простаивают. Это приводит к росту задержки первого токена до четырех секунд и вынуждает компании избыточно закупать оборудование для компенсации пиковых нагрузок.
В ответ на эти проблемы Amazon Web Services представила Amazon SageMaker HyperPod Inference Gateway. Это система маршрутизации, нативная для Kubernetes и учитывающая состояние GPU, которая устанавливается как управляемый аддон EKS на существующую инфраструктуру HyperPod. Ключевое преимущество решения — отсутствие необходимости вносить изменения в серверы моделей или клиентские приложения. Компания заявляет, что пользователи чат-ботов, ожидавшие первый токен 4,4 секунды, теперь получают его менее чем за 800 миллисекунд.
Архитектура продукта построена на двух уровнях. Первый уровень представляет собой шлюз для каждого кластера, состоящий из трех компонентов на базе открытого стандарта Gateway API Inference Extension. Envoy Gateway выступает в роли высокопроизводительного L7-прокси, обрабатывающего HTTPS-трафик. Body-Based Router анализирует тело запросов в формате OpenAI, извлекает имя модели и направляет трафик в соответствующий пул. Интеллектуальным ядром служит Endpoint Picker (EPP), который использует метрики Prometheus для выбора оптимального бэкенда.
Алгоритм EPP оценивает несколько факторов: утилизацию кэша KV, глубину очереди запросов, наличие нужного адаптера LoRA в памяти, частоту попадания в кэш префиксов и количество активных задач. Каждому фактору можно назначить вес, что позволяет настроить поведение под конкретные задачи — от чувствительных к задержке чатов до пакетной обработки с упором на пропускную способность. Второй уровень, Global Inference Router, находится в стадии разработки и будет обеспечивать координацию между кластерами и регионами, включая глобальное ограничение частоты и управление трафиком с учетом стоимости.
Развертывание системы занимает около пяти минут и не требует установки сайдкаров или сервисных мешей. Процесс включает установку аддона, маркировку подов моделей и применение конфигурационного ресурса InferenceGatewayConfig. Шлюз предоставляет стандартный OpenAI-совместимый эндпоинт, поэтому существующий клиентский код работает без изменений. Решение поддерживает мульти-модельную маршрутизацию: один шлюз может обслуживать несколько моделей, автоматически направляя запросы в нужные пулы на основе поля model в теле запроса.
Отдельного внимания заслуживает работа с адаптерами LoRA. Gateway направляет запросы к подам, где нужный адаптер уже загружен в память GPU, что устраняет задержки, связанные с его подгрузкой. Если адаптер отсутствует во всех нодках, запрос уходит на под с наибольшим свободным ресурсом для быстрой загрузки. Система также обладает механизмами самовосстановления и предоставляет встроенную наблюдаемость: метрики уровня подов, пулов, кластеров и всего флота выводятся в Prometheus, Grafana и Amazon CloudWatch.
В ходе бенчмаркинга на моделях от 8 до 235 параметров, развернутых на инстансах H100 и A10G, было подтверждено превосходство интеллектуальной маршрутизации над стандартным round-robin. Наибольший прирост производительности наблюдается в сценариях со смешанным парком GPU, всплесками трафика и общими префиксами промптов. На однородном кластере со стабильной нагрузкой разница минимальна, однако именно неравномерность нагрузки является нормой для продакшн-окружений.
SageMaker HyperPod Inference Gateway (первый уровень) доступен сегодня в регионах, где поддерживается инференс-аддон. В планах компании — внедрение глобального роутера, канареечного разделения трафика и приоритетных очередей запросов. Источник: web:AWS Machine Learning — https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/