Сегодня 05 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI выпустила GPT-Realtime-2 и ещё две голосовые модели, но доступны они лишь через API

Компания OpenAI объявила о включении в API ряда новых возможностей голосового интеллекта, призванных помочь разработчикам создавать приложения, способные «говорить», расшифровывать и переводить разговоры с пользователями.

 Источник изображения: Zac Wolff/unsplash.com

Источник изображения: Zac Wolff/unsplash.com

В частности, разработчикам через API Realtime теперь доступны три новые модели голосового управления в реальном времени — GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper. Новые модели поддерживают более естественное голосовое взаимодействие, перевод в реальном времени и транскрипцию речи в текст с низкой задержкой.

Модель GPT-Realtime-2 создана для голосового взаимодействия в реальном времени, обладая способностью анализировать запросы, вызывать инструменты, обрабатывать исправления и естественно продолжать разговор. В отличие от своей предшественницы GPT-Realtime-1.5, эта модель построена на основе логики класса GPT-5, разработанной для обработки более сложных запросов от пользователей.

GPT-Realtime-2 включает в себя следующие новые возможности для голосовых агентов:

  • Преамбулы: разработчик может добавить короткие фразы, например, «позвольте мне это проверить», перед завершением ИИ-агентом задачи.
  • Параллельные вызовы инструментов: модель может использовать сразу несколько инструментов одновременно, информируя пользователя.
  • Улучшенное восстановление: модель может более корректно реагировать на ошибки, вместо того чтобы завершать работу без комментариев.
  • Расширенный контекст: контекстное окно увеличено с 32K до 128K.
  • Улучшенное понимание предметной области: модель лучше запоминает специализированные термины, имена собственные и лексику, связанную со здравоохранением.
  • Управление тоном: модель может корректировать интонацию в зависимости от ситуации.
  • Регулируемый уровень сложности рассуждения: разработчики могут выбирать между минимальным, низким, средним, высоким и сверхвысоким уровнями.

Модель GPT-Realtime-Translate предназначена для предоставления услуг перевода в реальном времени, «поддерживая темп» разговора с пользователем. Модель поддерживает более 70 языков ввода (то есть языков, которые она может понимать) и 13 языков вывода (языков, которые она передает говорящему). Сообщается, что модель может сохранять смысл, подстраиваясь под говорящего, даже когда пользователи меняют контекст, используют региональное произношение или специфическую для предмета лексику.

Модель GPT-Realtime-Whisper — потоковая модель транскрипции, созданная для преобразования речи в текст с низкой задержкой.

«Запускаемые нами модели переводят аудио в реальном времени из простого диалога в голосовые интерфейсы, которые действительно могут работать: слушать, рассуждать, переводить, транскрибировать и предпринимать действия по мере развития разговора», — сообщила компания.

Стоимость GPT-Realtime-2 составляет $32 за 1 млн входных аудиотокенов, $0,40 за 1 млн кешированных входных токенов и $64 за 1 млн выходных аудиотокенов. Стоимость GPT-Realtime-Translate составляет $0,034 в минуту, а GPT-Realtime-Whisper — $0,017 в минуту. Разработчики могут опробовать новые модели на онлайн-платформе OpenAI Playground.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 3 ч.
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 4 ч.
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 4 ч.
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 5 ч.
С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды 6 ч.
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 8 ч.
Nintendo анонсировала сразу две игровые презентации Nintendo Direct — обе пройдут на следующей неделе 9 ч.
Патчи для Heroes of Might & Magic: Olden Era станут выходить чаще — разработчики готовят два крупных обновления 10 ч.
AMD выпустила драйвер с поддержкой Onimusha: Way of the Sword и The Blood of Dawnwalker 11 ч.
ИИ-агенты OpenAI захватили немецкий сайт и превратили его в подпольный форум для ИИ 11 ч.
Больше инвестиций — ниже тарифы: США будут оказывать давление на поставщиков полупроводниковых компонентов 3 ч.
Tesla запустила Cybercab без руля и педалей — через полдня к машинам возникли вопросы у регулятора 3 ч.
DLSS 5 портировали на видеокарты Radeon RX 9000 — производительность пока оставляет желать лучшего 3 ч.
Дефицит и рост цен не отпугнули покупателей видеокарт — продажи выросли на 14 % 6 ч.
Представлен защищённый ноутбук Oukitel RG14-P с солнечной батареей в крышке 6 ч.
CXMT удвоит мощности по выпуску памяти, но приблизиться к Samsung и SK Hynix ей не светит 6 ч.
Из-за подорожания компонентов ноутбук за $900 теперь должен стоить $1600 8 ч.
Из-за реформы лицензирования связи в России могут исчезнуть несколько тысяч малых интернет-провайдеров 8 ч.
Equinix представила решения Fabric One и Inference Exchange для распределённого ИИ-инференса в системах NVIDIA и Together AI 9 ч.
AMD представила рабочую станцию Threadripper Halo Station — 96 ядер, 2 Тбайт ОЗУ и до четырёх Instinct MI350P 10 ч.