AWS представила списки предпочтений инстансов для ускорения запуска задач обучения в SageMaker ИИ

AWS Machine Learning · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Amazon Web Services анонсировала функцию Instance preference lists, позволяющую указывать до пяти типов GPU-инстансов для автоматического поиска доступных мощностей. Это решение устраняет необходимость в ручном управлении очередями и повышает скорость старта критически важных задач обучения моделей.

Ценность: Функция решает одну из ключевых проблем масштабирования ИИ — дефицит конкретных типов GPU в периоды пиковой нагрузки. Автоматизация выбора инстансов снижает операционную нагрузку на инженеров и позволяет более эффективно использовать выделенные ресурсы, что критично для компаний, работающих с большими языковыми моделями.

Одной из главных сложностей при обучении и дообучении ИИ-моделей в промышленных масштабах является обеспечение доступа к необходимым графическим процессорам. В периоды высокой нагрузки предпочтительный тип GPU может быть недоступен, а привязка задачи к конкретной конфигурации заставляет команды ждать или вручную перебирать альтернативы. Amazon Web Services представила функцию Instance preference lists для Amazon SageMaker AI Training Jobs и Processing Jobs, которая позволяет указать упорядоченный список из до пяти приемлемых типов инстансов. Система автоматически оценивает этот список в порядке приоритета и запускает задачу на первом доступном типе, что сокращает время ожидания и возвращает инженеров к разработке моделей.

Ранее команды часто прибегали к созданию собственных скриптов для повторных попыток запуска задач, отмены зависших запросов и переключения на другие типы инстансов. Такие обходные пути были хрупкими, не интегрировались с опциями выделенной мощности, такими как Flexible Training Plans (FTP), и создавали дополнительную операционную нагрузку. Новый подход устраняет необходимость в ручных циклах повторных попыток и сложных скриптах мониторинга. Вместо этого платформа самостоятельно оценивает несколько типов инстансов при создании задачи в рамках одного API-вызова.

Механизм работы заключается в том, что SageMaker AI выполняет однократную проверку в памяти по всем указанным типам инстансов и выбирает первый, у которого есть свободная мощность. Если ни один из типов не доступен в момент оценки, задача попадает в эффективную событийно-управляемую очередь и автоматически повторяется при появлении ресурсов. Максимальное время ожидания регулируется параметром MaxPendingTimeInSeconds, который действует только для задач с ускоренными вычислительными инстансами, такими как семейства ml.p, ml.g и ml.trn.

Особое значение функция имеет для организаций, использующих Flexible Training Plans. Теперь можно привязать план обучения к конкретным предпочтениям в списке, оставив другие типы на помесячной оплате (on-demand). Система сначала проверяет выделенную мощность, а при ее отсутствии переходит к следующему типу в списке, используя стандартные тарифы. Это позволяет гарантировать запуск задач даже при полном использовании выделенных ресурсов без необходимости ручного переключения.

Для реализации доступны примеры кода через Amazon SageMaker Python SDK v3. Пользователи могут настроить одинаковое количество инстансов для разных типов GPU или использовать разные количества для достижения эквивалентной производительности, учитывая различия в архитектуре чипов. Например, можно указать два инстанса ml.g6.48xlarge как первый приоритет и четыре ml.g5.48xlarge как запасной вариант для компенсации меньшей производительности на GPU.

Важно отметить, что SageMaker AI не проверяет совместимость между разными типами инстансов, такими как поддержка Elastic Fabric Adapter (EFA) или версии драйверов. Ответственность за обеспечение работоспособности контейнера обучения на всех указанных типах лежит на пользователе. Также функция доступна для задач обработки данных, где настройки указываются в ClusterConfig, однако интеграция с Training Plans поддерживается только для задач обучения.

Внедрение Instance preference lists превращает управление GPU-мощностями из инженерной задачи в простую конфигурацию. Вместо создания сложной логики повторных попыток и мониторинга, разработчики заранее заявляют свою гибкость, позволяя платформе самостоятельно находить доступные ресурсы. Это способствует более высокому использованию мощностей и ускорению итераций в разработке ИИ-моделей.