Голосовой ввод — это диктовка заданий голосом прямо в чат агента. Нажмите кнопку микрофона в поле ввода, проговорите задание — распознанная речь появится текстом в поле, и сообщение уйдёт агенту как обычное. Печатать длинное задание не обязательно.
Что это и зачем
Длинные задания удобно надиктовывать — особенно с телефона или планшета, где печатать несподручно. Проговорили — и текст готов в поле ввода, остаётся только отправить. Больше никакого «разбираюсь, как сформулировать, и печатаю пять минут»: сказали своими словами — агент получил задание.
Как включить
Настраивать ничего не нужно: кнопка микрофона уже есть в поле ввода сообщения в интерфейсе Research Agent. Она появляется, когда распознавание речи включено в настройках Pastukhov Agent, — Research Agent использует его возможности и собственных настроек речи не имеет. Если кнопки микрофона нет, включите распознавание речи в настройках агента.
Как это работает
Всё просто: нажали кнопку микрофона («Начать запись голоса») — началась запись, кнопка пульсирует. Проговорили задание, нажали снова («Остановить запись») — и распознанный текст уже в поле сообщения, в том месте, где вы печатали. Отправьте его как обычное сообщение — кнопкой отправки или нажатием Enter. Перед отправкой текст можно поправить.
Останавливаться после каждой фразы не нужно. Серверные способы распознавания отправляют накопленный фрагмент примерно каждые пять секунд и вставляют текст по мере поступления. Браузерное распознавание показывает живой предварительный текст над полем ввода, пока вы говорите, и вставляет готовые фразы сразу.
Движки распознавания
Способ распознавания выбирается в настройках агента, а Research Agent подстраивается под него сам. Работают два семейства:
- Браузерный — встроенное в браузер распознавание речи (Web Speech API). Распознаёт прямо в браузере, бесплатно и без ключей; работает в Chrome, Edge и Safari. Звук обрабатывается облачным сервисом браузера, а интерфейсу нужно подключение к интернету;
- Серверные — локальный Whisper на сервере агента или облачные сервисы (OpenAI, Groq, OpenRouter, Deepgram, ElevenLabs и собственный OpenAI-совместимый сервис). Research Agent записывает голос с микрофона и передаёт аудио агенту, а тот распознаёт его своим движком. Какой именно серверный движок настроен, интерфейсу неважно: модель, язык и ключи разрешаются на стороне агента.
Что может пойти не так
Обо всех проблемах интерфейс сообщает понятными подсказками:
- браузер не поддерживает распознавание речи — например, во встроенном распознавании Firefox такой возможности нет; в этом случае выберите серверный движок в настройках агента;
- нет доступа к микрофону — разрешите доступ в настройках браузера; если микрофон не определяется — проверьте настройки устройства;
- браузерному движку нужно подключение к интернету;
- если запись оказалась пустой или слишком тихой, появится подсказка «Проверьте микрофон или говорите громче».
Где доступно
Голосовой ввод работает в любом чате агента в интерфейсе Research Agent — кнопка микрофона стоит в поле ввода сообщения. Та же кнопка есть и в каждой строке очереди промптов: задание можно надиктовать и добавить в очередь, не печатая (см. «Очередь промптов»).
Два уточнения. Распознанный текст всегда уходит агенту как обычное сообщение — отдельного голосового канала нет. И сам Research Agent речь не распознаёт: он либо отдаёт её браузеру, либо записывает и передаёт агенту — поэтому для голосового ввода нужен настроенный и работающий Pastukhov Agent.