---
title: "Скачивание страниц"
id: "1323"
type: "page"
slug: "fetch"
published_at: "2026-08-15T22:46:41+00:00"
modified_at: "2026-08-16T16:12:01+00:00"
url: "https://pastukhov.com/agents/research/docs/fetch"
markdown_url: "https://pastukhov.com/agents/research/docs/fetch.md"
excerpt: "Скачивание превращает найденные ссылки в материал для анализа: страницы сохраняются, конвертируются в чистый Markdown и…"
---

# Скачивание страниц

[https://pastukhov.com/agents/research/docs/fetch.md](https://pastukhov.com/agents/research/docs/fetch.md)

Скачивание превращает найденные ссылки в материал для анализа: страницы сохраняются, конвертируются в чистый Markdown и раскладываются по датам. Для упрямых сайтов — четыре метода скачивания с эскалацией от прямого запроса до полноценного браузера.

## Четыре метода

- **Direct** — прямые HTTP-запросы: быстро и дёшево, работает для большинства сайтов;
- **Proxied** — запросы через прокси: смена IP для обхода гео- и rate-ограничений;
- **BrowserEmulation** — эмуляция браузера: правильные заголовки и отпечаток клиента для анти-бот проверок;
- **RemoteBrowser** — удалённый браузер на Playwright: рендеринг JavaScript,SPA и страницы, которые без него не отдают контент.

Методы подключаются как сервисы в разделе Services и выстраиваются в цепочку фоллбека Direct → Proxied → BrowserEmulation → RemoteBrowser: если URL не скачивается одним способом, система сама пробует следующий. Обход блокировок и анти-бот защит на уровне CDN происходит без участия пользователя.

## Конвертация в Markdown

Каждая скачанная страница конвертируется в чистый Markdown с помощью Trafilatura: остаётся содержимое, уходит навигация, реклама и разметка. Дальнейшая работа — чанкинг, извлечение, чтение — идёт уже по тексту, а не по HTML.

## Хранение

Файлы раскладываются по датам: `{RESEARCH_AGENT_FETCH_FOLDER}/yyyy-MM-dd/{domain}_{slug}_{hash8}.md` — по умолчанию `/data/fetch` внутри постоянного volume. В базе хранится абсолютный путь и размер каждого файла, интерфейс отдаёт содержимое через защищённый от path-traversal эндпоинт — Markdown можно читать прямо в приложении.

## Сессии скачивания

Раздел Fetch показывает сессии скачивания: статусы, историю и результаты, повторные запуски. У отчёта в библиотеке видны сессии поиска и скачанные исходники — проследить, откуда взят каждый факт, можно в один клик.

## Доступ внешних агентов

Скачивание доступно снаружи через `POST /api/agent/fetch` с заголовком `X-API-Key` — внешние агенты получают тот же конвейер с фоллбеком методов и конвертацией в Markdown.

[← Оглавление документации](/agents/research/docs)
