---
title: "Голосовой ввод"
id: "1947"
type: "page"
slug: "speech"
published_at: "2026-09-20T13:43:40+00:00"
modified_at: "2026-09-22T15:01:36+00:00"
url: "https://pastukhov.com/agents/telegram/docs/speech"
markdown_url: "https://pastukhov.com/agents/telegram/docs/speech.md"
excerpt: "Голосовой ввод — это диктовка заданий голосом прямо в чат агента. Нажмите кнопку микрофона в…"
---

# Голосовой ввод

[https://pastukhov.com/agents/telegram/docs/speech.md](https://pastukhov.com/agents/telegram/docs/speech.md)

**Голосовой ввод — это диктовка заданий голосом прямо в чат агента.** Нажмите кнопку микрофона в поле ввода, проговорите задание — распознанная речь появится текстом в поле и уйдёт агенту обычным сообщением. Печатать длинное задание не обязательно.

## Что это и зачем

Задания агенту удобно наговаривать, а не печатать: «посмотри, что вышло в источниках за неделю, и предложи три поста» — сказали вслух, и текст уже в поле ввода. Особенно выручает с телефона и планшета, где печатать долго, и когда мысль нужно поймать быстро.

## Как включить

Настраивать ничего не нужно: кнопка микрофона уже есть в поле ввода сообщения. Она появляется, когда распознавание речи включено в настройках вашего Pastukhov Agent, — Telegram Agent пользуется его возможностями и собственных настроек речи не имеет. Если кнопки микрофона нет, включите распознавание речи в настройках агента. Голосовой ввод — часть чата с агентом, поэтому он требует настроенного и работающего Pastukhov Agent.

## Как это работает

Нажмите кнопку микрофона («Начать запись голоса») — кнопка начнёт пульсировать, и запись пойдёт. Проговорите задание и нажмите кнопку ещё раз («Остановить запись»): распознанный текст появится в поле в том месте, где вы печатали, — его можно поправить перед отправкой. Останавливаться после каждой фразы не нужно.

Пока вы говорите, предварительный текст показывается прямо над полем ввода, а готовые фразы вставляются в поле сразу. Работает это в любом чате агента — и в панели чата, и в строках очереди промптов: задание можно надиктовать и поставить в очередь, не печатая.

## Способы распознавания

Способ распознавания выбирается в настройках агента, а Telegram Agent подстраивается под него сам. Работают два семейства:

- **В браузере** — встроенное распознавание речи браузера. Работает бесплатно и без ключей, в Chrome, Edge и Safari; звук не покидает ваш браузер, но нужен доступ в интернет;
- **На стороне агента** — локальная модель Whisper на вашем сервере агента или облачные сервисы распознавания. Telegram Agent записывает голос с микрофона, передаёт запись агенту, а тот распознаёт её своим движком — поэтому распознавание можно держать полностью у себя, без внешних сервисов.

## Что может пойти не так

О проблемах интерфейс сообщает понятными подсказками:

- первый запуск распознавания на вашем сервере занимает время: движок ставит ffmpeg и загружает модель, а у кнопки микрофона появляются подсказки «установка ffmpeg» и «загрузка модели». Это разовая подготовка — дальше распознавание идёт сразу;
- браузер не поддерживает встроенное распознавание речи — тогда выберите распознавание на стороне агента в настройках агента;
- нет доступа к микрофону — разрешите доступ в настройках браузера; если микрофон не определяется, проверьте настройки устройства;
- запись оказалась пустой или слишком тихой — появится подсказка «Проверьте микрофон или говорите громче».

## Где доступно

Кнопка микрофона стоит в поле ввода панели чата и в каждой строке очереди промптов. Распознанный текст уходит агенту как обычное сообщение — отдельного «голосового» канала нет, и отправить его можно только с действующей лицензией (как и любое другое сообщение в чат). Подробнее о чате — в разделе [Агент](/agents/telegram/docs/agent)
, об очереди заданий — там же, в разделе «Промпты и автоотправка».

[← Оглавление документации](/agents/telegram/docs)
