Скачивание страниц

Скачивание превращает найденные ссылки в материал для анализа: страницы сохраняются, конвертируются в чистый Markdown и раскладываются по датам. Для упрямых сайтов — четыре метода скачивания с эскалацией от прямого запроса до полноценного браузера.

Четыре метода

  • Direct — прямые HTTP-запросы: быстро и дёшево, работает для большинства сайтов;
  • Proxied — запросы через прокси: смена IP для обхода гео- и rate-ограничений;
  • BrowserEmulation — эмуляция браузера: правильные заголовки и отпечаток клиента для анти-бот проверок;
  • RemoteBrowser — удалённый браузер на Playwright: рендеринг JavaScript,SPA и страницы, которые без него не отдают контент.

Методы подключаются как сервисы в разделе Services и выстраиваются в цепочку фоллбека Direct → Proxied → BrowserEmulation → RemoteBrowser: если URL не скачивается одним способом, система сама пробует следующий. Обход блокировок и анти-бот защит на уровне CDN происходит без участия пользователя.

Конвертация в Markdown

Каждая скачанная страница конвертируется в чистый Markdown с помощью Trafilatura: остаётся содержимое, уходит навигация, реклама и разметка. Дальнейшая работа — чанкинг, извлечение, чтение — идёт уже по тексту, а не по HTML.

Хранение

Файлы раскладываются по датам: {RESEARCH_AGENT_FETCH_FOLDER}/yyyy-MM-dd/{domain}_{slug}_{hash8}.md — по умолчанию /data/fetch внутри постоянного volume. В базе хранится абсолютный путь и размер каждого файла, интерфейс отдаёт содержимое через защищённый от path-traversal эндпоинт — Markdown можно читать прямо в приложении.

Сессии скачивания

Раздел Fetch показывает сессии скачивания: статусы, историю и результаты, повторные запуски. У отчёта в библиотеке видны сессии поиска и скачанные исходники — проследить, откуда взят каждый факт, можно в один клик.

Доступ внешних агентов

Скачивание доступно снаружи через POST /api/agent/fetch с заголовком X-API-Key — внешние агенты получают тот же конвейер с фоллбеком методов и конвертацией в Markdown.

← Оглавление документации