Pulpie: экономичная очистка веба с помощью энкодерных моделей
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компания Feyn представила Pulpie — семейство открытых моделей для извлечения основного контента из HTML, которые на 20 раз дешевле конкурентов при сопоставимом качестве. Архитектура на базе энкодеров позволяет обрабатывать данные быстрее и эффективнее традиционных декодеров.
Ценность: Снижение стоимости очистки веб-данных критически важно для масштабирования LLM-приложений, так как качество входных данных напрямую влияет на точность ответов моделей.
Основатель компании Feyn Шрейаш представил на Hacker News проект Pulpie — семейство моделей, предназначенных для «очистки» веб-страниц. Инструмент автоматически удаляет из сырого HTML-кода нежелательные элементы, такие как реклама, футеры и боковые панели, возвращая пользователю только основной контент в формате HTML или Markdown. Разработчики утверждают, что их решение обеспечивает качество извлечения данных, сопоставимое с лучшими существующими стандартами (SOTA), но при этом обходится в 20 раз дешевле.
Экономическая эффективность Pulpie демонстрируется на конкретных цифрах: очистка одного миллиарда веб-страниц с использованием данной технологии стоит около $7 900. Для сравнения, аналогичная задача с применением Dripper — текущего лидера рынка среди экстракторов — обойдется в $159 000. Такая разница в стоимости обусловлена фундаментальным отличием в архитектуре моделей.
Большинство ведущих экстракторов работают на базе декодеров, которые генерируют вывод по одному токену за раз. Каждый шаг такого процесса требует чтения всей модели из памяти, что делает вычисления ограничивающими фактором пропускной способности памяти (memory-bound). Pulpie же использует энкодеры: модель выполняет один прямой проход по всему входному HTML и помечает каждый блок как «шум» или «контент». Это превращает задачу в compute-bound, то есть ограниченную вычислительными мощностями, а не скоростью памяти.
Данная архитектурная особенность позволяет Pulpie оптимально работать даже на более дешевом GPU-оборудовании, где соотношение вычислительных ресурсов к пропускной способности памяти обычно выше. Это делает решение доступным для широкого круга разработчиков и компаний, которым не нужны самые мощные, но и самые дорогие серверы.
Мотивация к созданию Pulpie возникла из практического опыта команды Feyn при разработке системы глубоких исследований (deep research harness). При работе с поисковыми API они столкнулись с проблемой «шумных» данных: в результаты поиска попадали рекламные блоки и навигационные элементы. В одном из случаев реклама «Gemini on Pixel» попала в контекст LLM и была включена в финальный ответ пользователю. Этот инцидент наглядно показал, как некачественные входные данные могут искажать интеллект модели.
Компания подчеркивает важность получения чистых данных по доступной цене для обеспечения надежности ИИ-систем. Все модели Pulpie являются открытыми и доступны на платформе Hugging Face, где также размещена информация о процессе обучения и инструкциями по использованию. Разработчики предлагают пользователям провести самостоятельное сравнение качества работы Pulpie и Dripper через интерактивную демонстрацию на Hugging Face Spaces.