Почему «предсказатель следующего токена» — неполная модель работы LLM

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Автор статьи утверждает, что описание больших языковых моделей как предсказателей следующего токена верно лишь для этапа дообучения и инференса, но игнорирует ключевую роль обучения с подкреплением. В современных моделях механизм выбора токена кодирует не имитацию данных, а максимизацию награды или симуляцию полезного ассистента.

Ценность: Понимание разницы между механикой генерации и целью обучения критически важно для корректной оценки возможностей и ограничений современных ИИ-систем, особенно в задачах, требующих рассуждений и поиска новых решений.

Распространенное утверждение о том, что большие языковые модели (LLM) являются «предсказателями следующего токена», технически верно, но концептуально неполно. Это описание работает как нулевое приближение: во время инференса модель действительно генерирует токены последовательно, один за другим. Аналогичный процесс происходит и на этапе предобучения (pre-training), где модель учится повышать вероятность появления тех токенов, которые фактически следовали за предыдущими в обучающих данных. В этом смысле базовая модель действительно обучена имитировать статистику языка из своего датасета.

Однако современные LLM, которыми мы пользуемся, проходят этап постобучения (post-training), ключевым элементом которого является обучение с подкреплением с проверяемыми наградами (RLVR). Здесь логика меняется фундаментально. В отличие от предобучения, где существует «правильный» следующий токен из данных, в RLVR модель исследует пространство возможных последовательностей и учится на основе итоговых результатов. Механизм обновления весов остается схожим — модель делает определенные последовательности более вероятными, — но причина иная: не потому, что они встречались в данных, а потому, что они привели к высокой награде.

Автор иллюстрирует эту разницу на примере шахматных движков. Первый тип движка обучен на базе партий гроссмейстеров и предсказывает ход, который с наибольшей вероятностью сделал бы человек-чемпион. Это классический «предсказатель следующего хода». Второй, идеализированный движок, исчерпывающе исследует все возможные партии и выбирает ход, ведущий к максимальной вероятности победы. Назвать такой движок предсказателем хода из датасета было бы странно: его цель — не имитация, а оптимизация результата.

Аналогично, RLVR позволяет LLM выходить за рамки имитации обучающих данных и находить решения, которых там никогда не было. Модель максимизирует награду, а не вероятность совпадения с текстом из прошлого. Это отличает ее от простого статистического генератора текста.

В статье также упоминается обучение с подкреплением на основе обратной связи человека (RLHF), которое смещает фокус модели с имитации данных на симуляцию полезного ассистента. Таким образом, фраза «предсказатель следующего токена» описывает лишь форму механизма — последовательную эмиссию символов, — но скрывает суть того, что этот механизм кодирует. За одним и тем же циклом генерации может стоять как простая статистика, так и сложная логика рассуждения и поиска оптимального решения.

Автор подчеркивает, что игнорирование этого различия приводит к неверному ментальному моделированию работы ИИ. Механизм инференса остается неизменным, но его внутренняя логика формируется не только предсказанием, но и максимизацией целевых функций. Это важно для понимания того, почему современные модели способны на задачи, выходящие за рамки простого дополнения текста.