Прогноз производительности Mac mini на M6 и M5 Pro: оценка скорости генерации токенов до релиза
Habr AI · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Автор статьи, владеющий парком тестовых Mac mini, представил предварительные расчёты скорости работы локальных LLM на будущих чипах Apple. Прогноз основан на эмпирическом правиле, выведенном из замеров на M4, и учитывает ограничения пропускной способности памяти.
Ценность: Статья предлагает методологию оценки производительности нового железа до его фактического тестирования, что полезно для планирования закупок и понимания реальных ограничений Apple Silicon в задачах генерации текста.
В преддверии старта продаж новых Mac mini на чипах M6 и M5 Pro, а также Mac Studio на M5 Max и M5 Ultra, автор публикации представил предварительный прогноз скорости генерации токенов для локальных языковых моделей. Поскольку реальных замеров пока нет, расчёты опираются на эмпирическое правило, выведенное из тестов базового M4: скорость генерации упирается в пропускную способность памяти, а не в вычислительные мощности CPU или GPU. Формула предполагает деление полосы пропускания памяти на размер весов модели с поправкой на накладные расходы (КПД), которая составила в среднем 0.83 при тестировании через Ollama.
Анализ спецификаций Apple от 25 августа выявил важные нюансы конфигураций. Например, у M6 с 16 ГБ памяти пропускная способность составляет 153 ГБ/с, тогда как версия с 32 ГБ обеспечивает 170 ГБ/с из-за задействования дополнительных каналов памяти. Аналогичная ситуация наблюдается у M5 Max: версия с 36 ГБ памяти и 32 ядрами графики имеет полосу 460 ГБ/с, в то время как старшая конфигурация с 48+ ГБ и 40 ядрами достигает 614 ГБ/с. Эти различия напрямую влияют на итоговую скорость работы моделей.
Согласно прогнозу, M6 не является радикальным апгрейдом для задач локального LLM: прирост над M4 составляет от 25 до 40%, а комфортным потолком остаётся модель на 8 миллиардов параметров. Для работы с более крупными моделями (14B и выше) рекомендуется выбирать конфигурации с 32 ГБ памяти, хотя выигрыш будет скромным. M5 Pro выделяется как первая машина в линейке mini, где модель на 32B параметров работает на приемлемой скорости (около 13 токенов/с), а версия с 64 ГБ памяти впервые позволяет запускать модели на 70B параметров, пусть и на низкой скорости (6 токенов/с), пригодной для фоновых задач.
Существенный скачок в производительности демонстрируют чипы уровня Max и Ultra. M5 Max обеспечивает комфортную работу с моделями на 70B параметров (13 токенов/с) и высокую скорость генерации для малых моделей (более 100 токенов/с для 8B), что критично для агентных сценариев с параллельными запросами. M5 Ultra позиционируется как решение исключительно для сверхкрупных моделей от 200B параметров и выше, таких как DeepSeek V3, где скорость генерации составляет около 2.6 токенов/с — медленно, но это единственная конфигурация в линейке, способная вместить такие веса целиком.
Автор честно указывает на потенциальные ошибки прогноза. Во-первых, для малых моделей (например, 3B) на мощных чипах узкое место смещается от памяти к вычислениям и накладным расходам движка, поэтому реальный потолок скорости будет значительно ниже расчетного. Во-вторых, архитектура M5 Ultra состоит из двух кристаллов, соединенных мостом, что может создать непредвиденные ограничения при распределении крупных моделей между ними. Также прогнозы не учитывают скорость обработки входного промпта (prefill), которая зависит от графических возможностей и может вырасти непропорционально.
Итоговая проверка прогноза запланирована на период после получения первых образцов техники. Автор обещает опубликовать вторую часть статьи с реальными замерами и сравнением их с предсказаниями, чтобы оценить точность используемой модели расчета. Методика тестирования открыта, и автор приглашает других владельцев нового железа провести аналогичные замеры для формирования общей картины производительности.