OpenAI

OpenAI представила GPT-Live-1 API: разработчики получили инструмент для создания голосовых приложений с одновременным говорением и слушанием

Автор: AI-Sphere· обновлено 11 сентября 2026 г. в 12:41· 5 мин чтения
Источники: the-decoder.com
OpenAI выпустила новую модель GPT-Live-1, предназначенную для разработки голосовых интерфейсов. API позволяет создавать приложения, которые могут говорить и слушать одновременно, открывая новые возможности для интерактивных голосовых сервисов.

OpenAI выпустила новую модель GPT-Live-1, предназначенную для разработки голосовых интерфейсов. API позволяет создавать приложения, которые могут говорить и слушать одновременно, открывая новые возможности для интерактивных голосовых сервисов.

Что произошло

Компания OpenAI предоставила разработчикам доступ к API под названием GPT-Live-1. Главное отличие новой модели от предшественников — способность обрабатывать аудиоввод и генерировать речевой вывод параллельно, без типичной для голосовых ассистентов последовательной задержки «запись — обработка — воспроизведение». Это делает диалог с искусственным интеллектом более естественным и приближает его к человеческому разговору.

Как это работает

Обычно голосовые ассистенты записывают фразу пользователя, отправляют её на сервер, дожидаются ответа и только затем начинают воспроизведение. GPT-Live-1 API использует механизм, при котором модель может принимать аудиопоток и одновременно возвращать синтезированную речь. Разработчикам не нужно организовывать сложную синхронизацию — API берёт на себя управление диалоговым циклом. Это особенно важно для сценариев, где требуется быстрая реакция: поддержка клиентов, голосовые помощники в автомобилях, системы реального перевода.

Почему это важно

Голосовые интерфейсы долгое время страдали от ощущения неестественности из-за задержек. Редакционный вывод: новый API может стать шагом к тому, чтобы разговор с ИИ перестал восприниматься как «вопрос-пауза-ответ». Для бизнеса это означает возможность создавать голосовых ассистентов, которые не обрывают пользователя и не заставляют его ждать. Для пользователей — более комфортное общение с автоматизированными сервисами. Однако стоит помнить, что качество распознавания и синтеза речи, а также итоговая задержка будут зависеть от конкретной реализации на стороне разработчика.

Что это даёт пользователю

Хотя конечные пользователи не будут напрямую работать с API, они почувствуют эффект в приложениях, созданных на его основе. Например:

  • Голосовые помощники, которые не перебивают и не заставляют повторять запросы из-за недослушанной фразы.
  • Системы поддержки клиентов, способные слышать и отвечать одновременно — это сократит время решения проблем.
  • Инструменты для синхронного перевода, которые могут обрабатывать речь говорящего на лету, без пауз.

Что пока неизвестно

OpenAI не раскрыла точные параметры использования: стоимость за минуту или за запрос, порог бесплатного доступа, доступность для разработчиков за пределами США. Также нет данных о точности распознавания речи в шумной среде, поддерживаемых языках и платформах (iOS, Android, веб). Официальной информации о дате релиза также пока не появилось. Эти детали стоит ожидать в последующих технических публикациях OpenAI.

Источники

#OpenAI#GPT-Live-1#речевой API#полный дуплекс

Читайте также

OpenAIOpenAI — модели, продукты и новости

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат