Сегодня 16 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google научила Gemini 2.5 понимать и передавать эмоции в диалогах

На конференции Google I/O 2025 компания анонсировала новую версию своей мультимодальной модели Gemini 2.5, которая теперь поддерживает генерацию аудио и диалогов в реальном времени. Эти возможности доступны в предварительной версии для разработчиков через платформы Google AI Studio и Vertex AI.

 Источник изображения: Google

Источник изображения: Google

Gemini 2.5 Flash Preview обеспечивает реалистичное голосовое взаимодействие с ИИ, включая распознавание эмоциональной окраски речи, адаптацию интонации и акцента, а также возможность переключения между более чем 24 языками. Модель может игнорировать фоновые шумы и использовать внешние инструменты, такие как «Поиск», для получения актуальной информации во время диалога.

Дополнительно, Gemini 2.5 предлагает расширенные функции синтеза речи (TTS), позволяя управлять стилем, темпом и эмоциональной выразительностью озвучивания. Поддерживается генерация диалогов с несколькими голосами, что делает модель подходящей для создания подкастов, аудиокниг и других мультимедийных продуктов.

Для обеспечения прозрачности, все сгенерированные моделью аудио маркируются с помощью технологии SynthID, что позволяет идентифицировать контент, как сгенерированный ИИ. Разработчики могут опробовать новые функции через вкладки Stream и Generate Media в Google AI Studio.

Gemini 2.5 демонстрирует значительный шаг вперёд в области мультимодальных ИИ-систем, объединяя модальности текстов, изображений, аудио и видео в единую платформу. Новые функции открывают широкие перспективы для создания интерактивных приложений, виртуальных ассистентов и инноваций в сфере образования.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Вот это поворот: на покупку издателя «Мира танков» и «Мира кораблей» нацелился бывший российский гонщик «Формулы-1» 5 ч.
Запущена подписка Meta One с расширенными ИИ-функциями, Muse и всеми платными функциями Instagram, WhatsApp и Facebook 5 ч.
OpenAI, Anthropic и Google DeepMind уже давно тайно обсуждают, как не дать ИИ уничтожить человечество 5 ч.
В Америке прошло закрытое тестирование загадочного AAA-файтинга — журналисты подозревают, что это Injustice 3 9 ч.
В серверных продуктах GitLab нашлась уязвимость, которую эксплуатируют хакеры — рекомендовано срочно обновиться 10 ч.
За пять дней в раннем доступе Steam продажи Wardogs превысили два миллиона копий — успех игры защитит разработчиков от увольнений 10 ч.
Anthropic отправила Claude на Уолл-стрит — ИИ теперь анализирует портфели и готовит встречи с клиентами 10 ч.
DeepSeek готовится выйти на биржу — её новым финансовым директором станет ветеран Уолл-стрит 11 ч.
ИИ-агенты стали регистрироваться в соцсетях и засыпать администраторов платформ спамом 11 ч.
Мессенджер XChat соцсети X внезапно пропал из магазинов приложений — проект, возможно, закрыт 12 ч.
144-ядерные Arm-процессоры Fujitsu MONAKA станут доступны в ноябре 50 мин.
Новая статья: Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то 3 ч.
Meta заставит ИИ работать дешевле — фирменные ускорители потеснят Nvidia в ЦОД уже в 2027 году 6 ч.
Роботы строят роботов: UBTech запустила умный завод человекоподобных машин 9 ч.
Поглощённый 11 лет назад Intel чипмейкер Altera подал конфиденциальную заявку на IPO 9 ч.
Samsung представила свой самый бюджетный смартфон Galaxy A08 — он получил 4 Гбайт LPDDR5X и батарею на 6000 мА·ч 9 ч.
Oppo представит фотофлагман Find X10 Pro Max и другие гаджеты 22 сентября 10 ч.
Юристы Latham & Watkins закупились NVIDIA-серверами — это плохой знак для Anthropic и OpenAI 10 ч.
Samsung выпустила Galaxy A18 — он стал толще и дороже предшественника, а о его чипе почти ничего не известно 10 ч.
Был завод, стал ИИ ЦОД: Teravolt предлагает переделать старые промышлынные объекты в дата-центры 10 ч.