Скачивание превращает найденные ссылки в материал для анализа: страницы сохраняются, конвертируются в чистый Markdown и раскладываются по датам. Для упрямых сайтов — четыре метода скачивания с эскалацией от прямого запроса до полноценного браузера.
Четыре метода
- Direct — прямые HTTP-запросы: быстро и дёшево, работает для большинства сайтов;
- Proxied — запросы через прокси: смена IP для обхода гео- и rate-ограничений;
- BrowserEmulation — эмуляция браузера: правильные заголовки и отпечаток клиента для анти-бот проверок;
- RemoteBrowser — удалённый браузер на Playwright: рендеринг JavaScript,SPA и страницы, которые без него не отдают контент.
Методы подключаются как сервисы в разделе Services и выстраиваются в цепочку фоллбека Direct → Proxied → BrowserEmulation → RemoteBrowser: если URL не скачивается одним способом, система сама пробует следующий. Обход блокировок и анти-бот защит на уровне CDN происходит без участия пользователя.
Конвертация в Markdown
Каждая скачанная страница конвертируется в чистый Markdown с помощью Trafilatura: остаётся содержимое, уходит навигация, реклама и разметка. Дальнейшая работа — чанкинг, извлечение, чтение — идёт уже по тексту, а не по HTML.
Хранение
Файлы раскладываются по датам: {RESEARCH_AGENT_FETCH_FOLDER}/yyyy-MM-dd/{domain}_{slug}_{hash8}.md — по умолчанию /data/fetch внутри постоянного volume. В базе хранится абсолютный путь и размер каждого файла, интерфейс отдаёт содержимое через защищённый от path-traversal эндпоинт — Markdown можно читать прямо в приложении.
Сессии скачивания
Раздел Fetch показывает сессии скачивания: статусы, историю и результаты, повторные запуски. У отчёта в библиотеке видны сессии поиска и скачанные исходники — проследить, откуда взят каждый факт, можно в один клик.
Доступ внешних агентов
Скачивание доступно снаружи через POST /api/agent/fetch с заголовком X-API-Key — внешние агенты получают тот же конвейер с фоллбеком методов и конвертацией в Markdown.