Измеренная скорость инференса LLM на Apple Silicon: данные с продакшн-флота

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Команда разработчиков опубликовала результаты бенчмаркинга скорости генерации текста языковыми моделями на процессорах Apple M4. Тесты проводились на реальном производственном оборудовании с использованием Ollama, а не на основе теоретических характеристик чипов.

Ценность: Материал предоставляет редкую возможность оценить реальные производительностные метрики Apple Silicon в задачах локального инференса LLM, опираясь на эмпирические данные, а не маркетинговые заявления или расчеты по спецификациям.

Вопрос о реальной производительности локальных языковых моделей на устройствах Apple часто остается в зоне теоретических предположений. Однако команда разработчиков из macyou.co опубликовала серию измерений, основанных на работе их собственного производственного флота. В отличие от многих публичных тестов, которые опираются на данные спецификаций или лабораторные условия, эти результаты получены на «продакшн-идентичном» оборудовании. Это позволяет получить более точную картину того, как модели ведут себя в реальных сценариях использования, где аппаратная платформа уже эксплуатируется для рабочих задач.

Тестирование проводилось на базе Mac mini с процессором Apple M4, оснащенного 16 ГБ оперативной памяти и пропускной способностью шины памяти 120 ГБ/с. Для запуска моделей использовалась версия Ollama 0.31.2, работающая в связке с llama.cpp и ускорением Metal под управлением macOS 15.3.1 (Sequoia). Все модели были загружены из официальной библиотеки Ollama в стандартном квантовании Q4_K_M, если не указано иное. Такой подход гарантирует воспроизводимость результатов и соответствие типичным условиям развертывания локальных LLM.

Методология тестирования была строго регламентирована. Для каждой модели выполнялся один прогон «на разогрев», результаты которого отбрасывались, чтобы исключить влияние кэширования и начальной загрузки. Далее проводилось три записанных прогона с фиксированным промптом: «Напишите объяснение в 300 слов о том, как работает механизм внимания в трансформерных моделях, для начинающего разработчика. Используйте одну конкретную аналогию». Бюджет генерации составлял 512 токенов, температура — 0.7. Скорость генерации и обработки промпта рассчитывалась на основе внутренних счетчиков Ollama, а итоговые значения представляли собой медиану из трех запусков с указанием разброса (максимум минус минимум).

Авторы подчеркивают, что скорость генерации на Apple Silicon в значительной степени определяется пропускной способностью памяти. Поэтому они ожидают пропорционального масштабирования производительности на более мощных чипах, таких как M4 Pro, M4 Max или M3 Ultra, которые также входят в их флот. Однако компания придерживается принципа публикации только тех данных, которые были непосредственно измерены. Для чипов и моделей, еще не прошедших тестирование, предлагается использовать калькулятор Mac LLM, который экстраполирует значения на основе константы эффективности, полученной в ходе этих экспериментов.

Сырые данные бенчмарков доступны в формате JSON под лицензией CC BY 4.0. Это позволяет исследователям и разработчикам самостоятельно анализировать результаты, проверять методологию или использовать данные для собственных расчетов. Авторы также открыты к обратной связи: если вы заметили проблемы с методом тестирования, вы можете сообщить об этом по адресу support@macyou.co. Такой уровень прозрачности и доступности данных выделяет данный материал на фоне многих других обзоров производительности.

Важно отметить, что эти результаты отражают состояние системы на дату последнего обновления — 13 июля 2026 года. Любые изменения в прошивках, драйверах или версиях библиотек могут повлиять на итоговые показатели. Тем не менее, предоставленные данные служат надежным ориентиром для оценки потенциала Apple Silicon в задачах локального инференса LLM.