Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила ИИ-модели для работы с изображениями и речью — они значительно экономнее аналогов OpenAI

Microsoft выпустила в публичный предварительный просмотр две новые модели искусственного интеллекта собственной разработки. MAI-Image-2.5-Pro является флагманским генератором изображений в ассортименте компании; MAI-Voice-2-Flash предназначается для распознавания речи в условиях больших объёмов корпоративных рабочих нагрузок.

 Источник изображений: microsoft.ai

Источник изображений: microsoft.ai

Софтверный гигант привёл данные о производительности обеих моделей как самый убедительный аргумент в пользу того, что он может использовать собственные продукты, не полагаясь на разработки OpenAI. Сейчас ИИ-модели Microsoft работают в большом числе продуктов компании: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure — это уже не исследовательские проекты, а рабочая инфраструктура, обслуживающая миллионы клиентов. «Каждое из этих улучшений — шаг к одной и той же цели: продукты Microsoft, работающие на основе моделей Microsoft», — подчеркнули в компании.

В кривой «качество-скорость-стоимость» две новые модели занимают противоположные позиции, и это намеренно. MAI-Image-2.5-Pro выступает разработкой премиум-класса: она генерирует изображения высокого качества, обеспечивает детальное их редактирование и точную отрисовку текста. При доступе через API работа с моделью обойдётся $5 за 1 млн текстовых токенов на вводе, $8 за 1 млн токенов изображений на вводе и $106 за млн токенов изображений на выводе. Базовая MAI-Image-2.5 недавно заняла второе место в рейтинге моделей для редактирования изображений на платформе Arena.

MAI-Voice-2-Flash имеет прямо противоположное позиционирование. Она работает вдвое быстрее, чем базовая MAI-Voice-2-Flash, и стоит на 32 % дешевле — $15 за 1 млн знаков. Модель разработана для рынка высокопроизводительной голосовой связи: кол-центров, голосовых агентов и приложений для обработки речи в реальном времени, где важна низкая задержка. У творческой студии, которая стремится к максимальной точности, совершенно иные потребности, чем у службы поддержки клиентов, обрабатывающей миллионы звонков в день.

Microsoft также рассказала об успехах во внедрении собственных моделей. Сервис Bing Image Creator полностью переведён на MAI-Image-2.5; в PowerPoint эта модель помогла снизить затраты на ресурсы графического процессора на 84 % по сравнению с OpenAI GPT-Image-2; она помогла оптимизировать обработку задач в облачном хранилище OneDrive. Новую MAI-Voice-2-Flash развернули на платформе Dynamics 365 Contact Center, снизив затраты на ресурсы графических процессоров на величину до 89 %; её также интегрировали в сервис Azure Voice Live для разработчиков. Сервис Microsoft Dragon Copilot, которым пользуются 170 000 медицинских учреждений, и который за I квартал обработал 28 млн обращений пациентов, переведён на модель MAI-Transcribe-1.5 с поддержкой 58 языков.

Облегчённая модель MAI-Code-1-Flash для написания кода в июне начала работать на платформе GitHub Copilot — по сравнению с OpenAI GPT-5.4 Mini и Anthropic Claude Haiku 4.5 она обеспечивает на 10 % более высокое принятие кода при сниженном на 10 % медианном потреблении токенов. Пользователи на 6 % чаще снова выбирают её, чем GPT-5.4 Mini, и на 11 % чаще, чем Claude Haiku 4.5. Microsoft дополнительно обучила её работе в Excel, и в большинстве наиболее распространённых задач она стала выступать на уровне GPT-5.6, хотя она достаточно мала, чтобы работать на устаревших ускорителях Nvidia H100 и даже A100.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Sonos попытается вернуть доверие пользователей с помощью ИИ-агентов — представлена ОС Sonos 27 для аудиосистем 4 мин.
Mozilla встроила блокировщик рекламы в Firefox для iPhone 25 мин.
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 58 мин.
Double Fine пообещала сделать Brutal Legend 2, но при одном условии 2 ч.
Группа фанатов возродит амбициозный сетевой экшен APB: All Points Bulletin от создателя GTA — подробности и геймплей 3 ч.
Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне 3 ч.
«Google Сообщения» начали отправлять людям чужие сообщения из старых переписок 3 ч.
Selectel усиливает ИИ-платформу новой функциональностью в кaталоге ИИ-моделей 3 ч.
Broadcom представила частное ИИ-облако VMware AI Factory, позаимствовав у NVIDIA термин для партнёрства с AMD 4 ч.
Медиаплеер VLC преодолел отметку в 7 миллиардов загрузок 6 ч.
Самая дешёвая GeForce RTX 5090 теперь стоить $5000 в США — в 2,5 раза дороже, чем на момент анонса 13 мин.
Учёные создали дрон с «кошачьими когтями» — он садится на айсберги и крутые ледяные скалы 16 мин.
Steam Deck получила поддержку более 30 тыс. игр из библиотеки Steam 2 ч.
SilverStone выпустила блок питания HELA 3000Rz на 3000 Вт — он справится с четвёркой RTX 5090 2 ч.
Samsung пустила на производство Galaxy Z Fold8 комплектующие от будущих моделей из-за ажиотажного спроса 3 ч.
При Тиме Куке акции Apple выросли на 2275 % — но Джону Тернусу не обязательно повторять его успех 3 ч.
Asus раскрыла характеристики ноутбука ProArt P14 — одного из первых на процессоре Nvidia RTX Spark 3 ч.
OpenAI отвергла новые обвинения Apple в краже технологий как безосновательные 3 ч.
Samsung рассказала, чем будет хороша память HBM5, zHBM и zNAND-O 3 ч.
Представлен компактный флагман POCO F9 Pro с двумя процессорами, быстрым экраном и 200-Мп камерой 3 ч.