Голосовой ввод — это диктовка заданий голосом прямо в чат агента. Нажмите кнопку микрофона в поле ввода, проговорите задание — распознанная речь появится текстом в поле и уйдёт агенту обычным сообщением. Печатать длинное задание не обязательно.
Что это и зачем
Задания агенту удобно наговаривать, а не печатать: «посмотри, что вышло в источниках за неделю, и предложи три поста» — сказали вслух, и текст уже в поле ввода. Особенно выручает с телефона и планшета, где печатать долго, и когда мысль нужно поймать быстро.
Как включить
Настраивать ничего не нужно: кнопка микрофона уже есть в поле ввода сообщения. Она появляется, когда распознавание речи включено в настройках вашего Pastukhov Agent, — Telegram Agent пользуется его возможностями и собственных настроек речи не имеет. Если кнопки микрофона нет, включите распознавание речи в настройках агента. Голосовой ввод — часть чата с агентом, поэтому он требует настроенного и работающего Pastukhov Agent.
Как это работает
Нажмите кнопку микрофона («Начать запись голоса») — кнопка начнёт пульсировать, и запись пойдёт. Проговорите задание и нажмите кнопку ещё раз («Остановить запись»): распознанный текст появится в поле в том месте, где вы печатали, — его можно поправить перед отправкой. Останавливаться после каждой фразы не нужно.
Пока вы говорите, предварительный текст показывается прямо над полем ввода, а готовые фразы вставляются в поле сразу. Работает это в любом чате агента — и в панели чата, и в строках очереди промптов: задание можно надиктовать и поставить в очередь, не печатая.
Способы распознавания
Способ распознавания выбирается в настройках агента, а Telegram Agent подстраивается под него сам. Работают два семейства:
- В браузере — встроенное распознавание речи браузера. Работает бесплатно и без ключей, в Chrome, Edge и Safari; звук не покидает ваш браузер, но нужен доступ в интернет;
- На стороне агента — локальная модель Whisper на вашем сервере агента или облачные сервисы распознавания. Telegram Agent записывает голос с микрофона, передаёт запись агенту, а тот распознаёт её своим движком — поэтому распознавание можно держать полностью у себя, без внешних сервисов.
Что может пойти не так
О проблемах интерфейс сообщает понятными подсказками:
- первый запуск распознавания на вашем сервере занимает время: движок ставит ffmpeg и загружает модель, а у кнопки микрофона появляются подсказки «установка ffmpeg» и «загрузка модели». Это разовая подготовка — дальше распознавание идёт сразу;
- браузер не поддерживает встроенное распознавание речи — тогда выберите распознавание на стороне агента в настройках агента;
- нет доступа к микрофону — разрешите доступ в настройках браузера; если микрофон не определяется, проверьте настройки устройства;
- запись оказалась пустой или слишком тихой — появится подсказка «Проверьте микрофон или говорите громче».
Где доступно
Кнопка микрофона стоит в поле ввода панели чата и в каждой строке очереди промптов. Распознанный текст уходит агенту как обычное сообщение — отдельного «голосового» канала нет, и отправить его можно только с действующей лицензией (как и любое другое сообщение в чат). Подробнее о чате — в разделе Агент, об очереди заданий — там же, в разделе «Промпты и автоотправка».