Common Crawl расширяет доступ к архивам через Hugging Face
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

С апреля 2026 года часть архивов Common Crawl доступна в хранилище Hugging Face, что позволяет использовать инструменты экосистемы HF для работы с данными. Проект опубликовал практические примеры подключения и предварительные результаты тестирования скорости загрузки.
Ценность: Интеграция упрощает доступ к крупномасштабным веб-архивам для исследователей, предоставляя альтернативу AWS S3 и расширяя возможности аналитики через DuckDB и fsspec.
С апреля 2026 года часть архивов Common Crawl стала доступна в хранилище Hugging Face Storage Bucket. Это дополнение к существующему размещению на AWS S3 открывает возможность использовать инструменты экосистемы Hugging Face для работы с крупномасштабными данными веб-архивов. Как отмечают разработчики, это делает доступ к данным более удобным за счет интеграции с привычными инструментами сообщества.
Данные в хранилище Hugging Face организованы по той же структуре каталогов, что и в S3. Пользователи могут просматривать файлы в браузере, передавать данные через командную строку hf CLI или монтировать хранилище как локальную файловую систему с помощью инструмента hf-mount. В нескольких регионах включено предварительное прогревание CDN, что, по заявлению компании, может улучшить пропускную способность при чтении данных, если вычислительные ресурсы находятся поблизости.
Для тех, кто уже использует S3-совместимые пайплайны, переход на Hugging Face не требует изменения кода. Достаточно указать S3-совместимый API хранилища HF, и данные будут загружаться через тот же клиент, но с серверов Hugging Face. Это обеспечивает бесшовную интеграцию в существующие рабочие процессы без необходимости переписывать логику доступа к данным.
Чтение WARC-файлов поддерживается через протокол hf://, который предоставляет файловый интерфейс, совместимый с fsspec. Инструмент warcio полностью поддерживает этот стандарт, позволяя извлекать записи и заголовки напрямую из хранилища Hugging Face. В примерах показано, как можно получить первые десять записей WARC-файла, включая типы записей и URL-адреса ответов, используя Python или командную строку warcio.
Для аналитических запросов Common Crawl предоставляет URL Index в формате Apache Parquet. Этот индекс хранится в том же хранилище HF и оптимизирован для эффективных массовых запросов. С помощью DuckDB пользователи могут выполнять запросы к индексу без необходимости скачивать все данные. В примерах продемонстрировано, как можно подсчитать количество страниц по доменам внутри конкретного топ-уровневого домена, используя Python-клиент DuckDB.
Команда Common Crawl провела предварительные эксперименты по оценке скорости загрузки отдельных записей из архива. Результаты показали, что загрузка из S3 в S3 (us-east-1) обеспечивает наивысшую скорость — до 3500 записей в секунду. Загрузка из HF в HF достигает 1500 записей в секунду. При этом загрузка из хранилища HF на edge-клиенты оказалась значительно медленнее из-за ограничений скорости и множества мелких запросов диапазонов, составляя менее 100 записей в секунду. Разработчики подчеркивают, что эти данные являются предварительными и рекомендуют проводить собственные измерения перед началом передачи больших объемов данных.
В репозитории cc-notebooks на GitHub доступны готовые Jupyter-ноутбуки с примерами из этой статьи и дополнительными материалами. Команда Common Crawl приглашает пользователей делиться обратной связью о работе с хранилищем Hugging Face через Discord или Google Group.