В ChatGPT есть две разные кнопки для голоса, и их постоянно путают. Диктовка в ChatGPT - это когда вы надиктовываете текст запроса вместо того, чтобы печатать: запись уходит на распознавание и возвращается словами в строку ввода, которые можно поправить перед отправкой. Голосовой разговор - совсем другое, там модель отвечает вслух. Разбираем, как диктовать текст в ChatGPT на телефоне и в браузере, что делать с ошибками распознавания и что происходит с записями вашего голоса.
Диктовка и голосовой разговор - это разные кнопки
Диктовка работает так: вы нажимаете значок микрофона, наговариваете сообщение, аудио уходит в модель на расшифровку и возвращается текстом. Этот текст можно править прямо в строке ввода и только потом отправлять. Вслух ChatGPT при этом ничего не произносит - ответ приходит обычным текстом.
Голосовой разговор - это диалог: ChatGPT слушает и отвечает голосом, а расшифровка добавляется в чат после разговора. OpenAI отдельно предупреждает, что такой транскрипт не дословный и может не совпадать с тем, что было сказано.
Рекомендация из справки простая. Голос - когда нужен живой обмен репликами или хочется проговорить мысль вслух. Диктовка - когда нужен один запрос, который вы просмотрите, отредактируете и отправите как текст.
На практике диктовка выигрывает там, где важна формулировка: письмо, техзадание, длинный промпт. Вы видите текст до отправки и успеваете поправить опечатку, а в разговоре модель уже ответила на то, что расслышала. Про сам голосовой режим у нас есть отдельные разборы: как разговаривать с ChatGPT вслух и настройки голоса, лимиты и режимы Live, Advanced, Standard.
Как надиктовать текст на телефоне и в вебе
Порядок одинаковый в приложении и в браузере:
- Откройте чат и найдите в строке ввода значок микрофона. Это именно диктовка, а не круглая кнопка голосового разговора рядом.
- Разрешите доступ к микрофону. В первый раз спросит приложение или браузер; если отказать, кнопка просто ничего не сделает, и разрешение придётся возвращать в настройках системы или сайта.
- Наговорите сообщение и остановите запись. В строке ввода появится расшифровка.
- Прочитайте текст, поправьте имена, числа и термины и отправьте как обычное сообщение.
Наш совет: говорите законченными короткими фразами. Длинную мысль без пауз модель расшифрует одним куском, и точки вы будете расставлять дольше, чем печатали бы сами.
Языки и что делать, если распознаёт плохо
Отдельного списка поддерживаемых языков в справке по диктовке нет. Зато есть настройка языка: Settings - Voice - Language. OpenAI пишет прямо, что выбор языка, на котором вы говорите чаще всего, помогает точнее понимать вашу речь. Если вы диктуете по-русски, а в настройке стоит английский, качество будет хуже.
По нашему опыту русский распознаётся нормально, а спотыкается диктовка на именах собственных, латинских названиях и длинных числах. Эти места и стоит просматривать перед отправкой.
Если модель регулярно слышит не то, помогают советы, которые OpenAI даёт для голоса: наушники вместо динамика, тихое место, громкость устройства выше. На iPhone можно открыть пункт управления во время записи, выбрать Mic Mode и включить Voice Isolation - фоновый шум срежется.
И главное отличие от разговора: при диктовке ошибка распознавания не стоит ничего. Текст лежит перед вами, вы его правите и отправляете уже правильным.
Что уходит на серверы и как это отключить
Записи распознаются не на телефоне. Когда вы нажимаете микрофон, аудио уходит на серверы OpenAI, там модель превращает его в текст и возвращает расшифровку.
Хранение устроено так: аудио с диктовки живёт столько же, сколько живёт сам чат. Удалили переписку - связанный аудиофрагмент удаляют в течение 30 дней. Исключения OpenAI называет честно: запись могут сохранить по соображениям безопасности или закона, а также если вы раньше согласились отдавать аудио на обучение и клип уже отвязали от вашего аккаунта.
Про обучение: у обычных пользователей, включивших передачу аудио, записи диктовки могут попасть в обучение моделей. Для бизнес-аккаунтов OpenAI по умолчанию не обучается ни на запросах, ни на ответах.
Выключается это в Settings - Data Controls: снимите переключатель Include your audio recordings либо отключите целиком Improve the model for everyone. Важный нюанс - настройка общая: выключив её, вы перестаёте делиться и записями диктовки, и записями голосовых разговоров.
Разница в сроках заметная: в режиме Standard голосового разговора аудио удаляется сразу после расшифровки, а у диктовки запись остаётся вместе с чатом.
Голоса: девять постоянных, Shimmer у GPT и сезонный Санта
Для диктовки голос не нужен: ChatGPT молчит и просто отдаёт текст. Голоса появляются там, где модель отвечает вслух.
В настройках сейчас девять голосов: Arbor, Breeze, Cove, Ember, Juniper, Maple, Sol, Spruce и Vale - от спокойных до бодрых. Меняется голос в Settings - Voice - Voice, но смена посреди разговора начинает новый звонок в том же чате.
Есть и голоса вне этого списка. В разговорах с пользовательскими GPT работает Advanced Voice и отдельный голос Shimmer, выбрать другой там нельзя.
Отдельная история - сезонные голоса. В конце 2024 года OpenAI добавляла голос Санты: он появлялся в списке голосов и по значку снежинки на главном экране, работал и в Advanced, и в Standard, а первый разговор с ним один раз обнулял дневной лимит Advanced. Разговоры были временными - без пользовательских инструкций и памяти, не попадали в историю чатов, не шли в обучение и хранились не дольше 30 дней. Держать голос обещали до начала января.
Страница про Санту в справке до сих пор не помечена как закрытая, но в текущем списке голосов его нет. Вывод простой: временные голоса OpenAI включает к праздникам и потом тихо убирает, постоянными остаются те девять из настроек.
Где купить ChatGPT из России
Кнопка оплаты подписки на сайте OpenAI из России не срабатывает: карта не проходит. Подписку оформляем на вашу почту: ChatGPT Go, Plus, Pro 5x и Pro 20x, плюс пополнение API. Оплата картой РФ или СБП, выдача в день заказа.
Обсуждение
0 комментариев