Векторная алгебра: как учебник 1990-х годов объясняет принципы работы современных нейросетей
Habr AI · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Автор статьи демонстрирует, что базовые принципы кодирования объектов в векторы, описанные в старых методичках по химии, идентичны механизмам работы современных моделей машинного обучения. От простого подсчета атомов до предсказания структуры белков AlphaFold, ключевым элементом остается преобразование предметной области в векторное пространство.
Ценность: Понимание фундаментальной связи между линейной алгеброй и нейросетями помогает разработчикам и исследователям видеть общую логику за разными архитектурами моделей, от простых регрессий до сложных трансформеров.
Встреча со старой методичкой по линейной алгебре, где молекула воды описывается как вектор (2, 0, 1), позволяет взглянуть на современные нейросети под новым углом. Автор материала отмечает, что такой подход, который в 1990-х годах назывался просто линейной алгеброй, по сути является ранним описанием концепции representation learning. Идея заключается в том, что любой объект можно представить как вектор в пространстве, где координаты имеют физический или смысловой смысл. В примере из химии каждый атом соответствует базисному вектору с единицей на своей позиции и нулями на остальных. Это практически идентично one-hot encoding, используемому сегодня для кодирования категориальных признаков в машинном обучении.
Если рассматривать молекулу как линейную комбинацию таких базисных векторов, мы получаем так называемый «bag of atoms» — мешок атомов. Порядок связей при этом теряется, остается только количество элементов. Автор показывает, что молярная масса вещества может быть вычислена как скалярное произведение вектора состава на вектор атомных масс. Это простейшая нейросеть с одним нейроном на выходе и без скрытых слоев. Весами в этой сети выступают известные из таблицы Менделеева константы. Если бы эти веса были неизвестны, их можно было бы восстановить с помощью линейной регрессии по парам данных «состав — масса», что демонстрирует способность алгоритмов находить статистические закономерности без явного знания физических законов.
Главный принцип, вытекающий из этого примера, состоит в том, что нейросеть работает с векторами и матрицами. Единственное требование к входным данным — возможность их представления в виде элементов векторного пространства, где определены операции сложения и умножения на число. Как только объект (будь то слово, пиксель или атом) преобразован в вектор, становится применимым весь аппарат линейной алгебры. Именно создание качественного отображения предметной области в векторное пространство составляет основную часть работы в задачах машинного обучения. Сама библиотека затем выполняет процесс обучения автоматически.
Однако подход «мешка атомов» имеет ограничения. Он не различает изомеры, такие как этанол и диметиловый эфир, которые имеют одинаковый состав, но разную структуру связей. В обработке естественного языка аналогичная проблема решалась с помощью позиционных эмбеддингов и механизмов внимания. В химии для учета топологии молекул используют графовые нейронные сети (GNN). В таком подходе молекула представляется графом, где атомы — вершины, а связи — ребра. Сеть учится агрегировать информацию о структуре, позволяя различать вещества с одинаковым составом, но разным строением.
Эта же логика масштабируется до моделей предсказания структуры белков. Вместо трех типов атомов здесь фигурируют 20 аминокислот. Простейшее кодирование — one-hot вектор длиной 21 — проигрывает более сложным эмбеддингам, так как не учитывает сходство свойств аминокислот. Модели вроде ESM используют обучаемые эмбеддинги, где похожие по свойствам аминокислоты оказываются ближе в векторном пространстве. Белок рассматривается как предложение, а сеть — как трансформер, предсказывающий замаскированные токены по контексту.
AlphaFold2 идет дальше, используя два слоя представления: множественное выравнивание последовательностей (MSA) и парное представление для каждой пары аминокислот. Ядро сети распределяет внимание по этим данным, извлекая пространственную структуру из статистики совместной эволюции. Более поздняя модель ESMFold отказалась от MSA, полагаясь на способность большой языковой модели самостоятельно усваивать эволюционную статистику. Несмотря на различия в архитектуре и вычислительных затратах, все эти системы опираются на тот же примитив: объект как координата в векторном пространстве.
Таким образом, путь от простой методички по химии до передовых моделей ИИ короче, чем кажется. Разница заключается лишь в размерности пространства и способе вычисления коэффициентов. Нейронные сети выполняют те же операции скалярного произведения, но в пространствах сверхвысокой размерности и с нелинейными активациями. Принципы, описанные полвека назад, остаются фундаментом для понимания того, как современные системы предсказывают структуру белков и понимают человеческий язык.