📌 OpenAI представляет голосовые системы, способные к рассуждению, переводу и расшифровке в реальном времени
– OpenAI представила голосовые модели, способные к рассуждению, переводу и транскрибированию в реальном времени.
OpenAI внедрила в свое API три голосовых модели, работающих в режиме реального времени.
Голосовые модели поддерживают ввод на 70 языках и используют GPT-Realtime-Whisper для моментальной транскрипции.
За Translate и Whisper взимается плата за минуту, тогда как GPT-Realtime-2 тарифицируется по токенам.
В среду OpenAI анонсировала новое поколение голосовых моделей в своем API, дав разработчикам инструменты для создания приложений, способных логически обрабатывать голосовые запросы, переводить на 70 наречий и преобразовывать речь в текст по мере ее возникновения.
Три модели получили наименования GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper. Они выводят голосовые интерфейсы ИИ за рамки простого обмена вопросами и ответами, позволяя помощнику ИИ слушать, обдумывать и действовать в процессе диалога.
GPT-Realtime-2 является передовой разработкой. OpenAI заявляет, что она предоставляет возможности рассуждения уровня GPT-5, что является заметным шагом вперед по сравнению с ее предшественником, GPT-Realtime-1.5.
Эта модель продемонстрировала на 15,2 % более высокие результаты в Big Bench Audio, эталоне аудиоинтеллекта, и на 13,8 % выше в Audio MultiChallenge, который проверяет следование указаниям в продолжительном диалоге.
Практические улучшения ориентированы на создателей голосовых агентов. Модель теперь оперирует контекстным окном объемом 128 КБ, что в четыре раза превышает предыдущий лимит в 32 КБ, и предлагает пять уровней настраиваемой сложности рассуждений: от “минимального” до “максимального”.
Она может инициировать работу с несколькими инструментами одновременно, справляться с провалами через голосовые подтверждения и выдавать короткие связующие фразы вроде “дайте мне проверить” в процессе обработки запроса.
GPT-Realtime-Translate обеспечивает перевод устной речи в реальном времени. Она принимает более 70 входных наречий и выдает результат на 13, чтобы успевать за скоростью говорящего.
GPT-Realtime-Whisper предоставляет потоковую передачу речи в текст (STT), конвертируя произносимое немедленно, не дожидаясь окончания предложения.
Ряд организаций уже получили ранний доступ. Zillow разрабатывает голосового ассистента, способного обрабатывать сложные запросы о недвижимости, управлять звонками с функциями поиска объявлений и соблюдать стандарты Fair Housing.
Компания сообщила о росте показателя успешности звонков на 26 пунктов в наиболее сложном контрольном испытании после оперативной доработки с помощью GPT-Realtime-2, достигнув 95 % против прежних 69 % .
Deutsche Telekom проводит тестирование мгновенного перевода для своей службы поддержки, позволяя звонящим говорить на удобном им наречии, пока модель обрабатывает обмен информацией с обеих сторон.
Priceline рассматривает возможность создания голосового помощника для путешественников, который сможет обрабатывать запросы на поиск авиабилетов, бронирование гостиниц и мгновенный перевод в рамках одной беседы.
Эти модели нацелены на предприятия, стремящиеся улучшить обслуживание клиентов, но также отмечается их потенциал в обучении, медиа, организации событий и на платформах для авторов контента.
OpenAI заявила, что внедрила в новые модели механизм модерации контента: триггеры могут прерывать диалог при обнаружении нарушений политики в отношении вредоносного контента. Компания назвала эти меры защитой от спама, обмана и иных форм неправомерного использования.
Что касается ценообразования, то за модели Translate и Whisper взимается почасовая плата. GPT-Realtime-2 тарифицируется за использованные токены. Все три модели доступны через Realtime API от OpenAI, доступ к которому осуществляется через соединения WebRTC, WebSocket и SIP.