Локальный инференс на Ryzen ИИ Max: опыт настройки и бенчмарки
Habr AI · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Автор статьи описывает процесс настройки локального запуска LLM на мини-ПК с процессором AMD Ryzen AI Max+ 395, используя Linux для доступа к объединенной памяти. В материале представлены результаты сравнения производительности различных моделей на ROCm и Vulkan в сопоставлении с видеокартой NVIDIA RTX 5060 Ti.
Ценность: Материал демонстрирует практическую возможность использования гибридных процессоров AMD для локального инференса больших языковых моделей, раскрывая нюансы настройки драйверов и сравнения производительности с дискретными GPU.
В последние месяцы рынок локальных ИИ-устройств претерпел изменения: цены на комплектующие выросли, а программное окружение для запуска моделей стало более сложным. Автор статьи, обладатель мини-ПК на базе Ryzen AI Max+ 395 с 128 ГБ оперативной памяти DDR5, потратил выходные на перенастройку системы после обновления драйверов и ядра Linux. Ключевой проблемой, которую он решил, стала необходимость корректного выделения видеопамяти. В отличие от Windows, где доступная VRAM ограничена BIOS-настройками, в Linux с использованием технологии TTM (Translation Table Maps) удалось задействовать почти весь объем оперативной памяти под нужды графического ядра, что критически важно для загрузки крупных моделей целиком в «видеопамять».
Для работы автор выбрал Ubuntu 26.04 и настроил два основных бэкенда: ROCm и Vulkan. Установка ROCm потребовала ручного добавления путей к библиотекам в переменную окружения, так как стандартные методы не всегда находили драйверы. Vulkan-сборка llama.cpp была скомпилирована вручную, что позволило получить альтернативный вариант запуска. Тестирование проводилось на моделях Qwen 3 Coder 30B и Qwen 3 Coder Next 80B в различных квантованиях (Q3, Q4, Q8) с контекстами от 5 000 до 45 000 токенов.
Сравнение с видеокартой NVIDIA RTX 5060 Ti 16 ГБ показало неоднозначную картину. Если модель не помещается в VRAM и слои выгружаются в оперативную память, скорость генерации на платформе AMD значительно падает из-за пропускной способности памяти. Однако, когда все слои модели помещаются в доступный объем памяти (благодаря 128 ГБ DDR5), Ryzen AI Max демонстрирует конкурентоспособные результаты. В частности, при загрузке всех слоев в VRAM, ROCm показал скорость генерации в 1,5 раза выше, чем NVIDIA, а Vulkan — в 2,7 раза выше. При этом наблюдается интересная динамика: ROCm эффективнее обрабатывает длинные промпты (prefill), тогда как Vulkan показывает лучшие результаты при генерации длинных ответов (decode).
Автор отмечает, что модель Qwen 3 Coder Next 80B демонстрирует более стабильную производительность при увеличении контекста по сравнению с 30B версией. Несмотря на то, что локальный инференс не может конкурировать с облачными решениями по скорости, он обеспечивает приватность и возможность работы с большими контекстами без ограничений API. В заключение автор планирует протестировать интеграцию с различными IDE-агентами и оптимизировать параметры запуска для конкретных задач разработки.