Оригинал материала: https://3dnews.ru/1148170

Математики из России научили ИИ-модели общаться без слов — знания большой модели можно эффективно передать маленькой

Российские математики из стартапа Mostik разработали способ, позволяющий ИИ-моделям обмениваться информацией без текстовых сообщений — с помощью математических значений, заложенных в их весах. На практике это означает, что возможности более крупной модели можно передать меньшей модели, чтобы гораздо эффективнее повысить её интеллектуальный уровень.

 Источник изображения: ChatGPT

Источник изображения: ChatGPT

Название стартапа отражает принцип работы технологии. Вместо последовательной передачи текстового ответа от одной модели другой, как это устроено сейчас, предложенная Mostik система использует математический «мост», связывающий их внутренние численные представления. «Мост» должен преобразовывать внутреннее численное представление одной модели в формат, который способна использовать другая — текст между моделями не появляется вовсе, и ни одна из LLM не дообучается.

Mostik заявляет, что уже использовала этот подход в системе для ARC-AGI-3 — соревнования, проверяющего способность ИИ обобщать правила и решать новые абстрактные задачи. По словам компании, её решение вышло в лидеры текущего рейтинга.

Для демонстрации метода Mostik соединила две китайские модели с открытыми весами: GLM-5.2 с 753 млрд параметров и версию Qwen-3.5 с 4 млрд параметров, способную работать на мобильных устройствах. Получившаяся гибридная система обошлась примерно в 20 раз дешевле флагманской GLM и показала результат ровно посередине между двумя исходными моделями.

Глава стартапа Саша Малышева, разработавшая эту идею, считает, что объединение нескольких моделей может оказаться более перспективным направлением развития ИИ, чем постоянное увеличение их размера. Одновременно технический руководитель ИИ-компании Lovable Владимир Арустамян отметил, что возможность соединять универсальные модели со специализированными системами в сфере биологии, физики и других областей могла бы стимулировать создание большего числа таких моделей.

«Техника Mostik означает, что можно приблизиться к качеству крупных моделей без того, чтобы крупная модель обрабатывала весь цикл, что дает существенное улучшение результатов при использовании лишь небольшой модели, работающей параллельно», — говорит Карл Туйлс, бывший специалист по информатике в Google DeepMind, знакомый с технологиями компании. По словам Туйлса, этот метод — очевидный выбор для любого, кто ставит перед собой задачу максимально эффективного запуска моделей.

Главным научным сотрудником Mostik является профессор Женевского университета и лауреат Филдсовской премии 2010 года Станислав Смирнов. По его словам, найти общий математический язык для двух ИИ-моделей оказалось неожиданно сложно, однако дальнейшее изучение подхода может помочь лучше понять принципы работы ИИ и их возможное сходство с мышлением людей. Если технология получит широкое распространение, она может повысить ценность моделей с открытыми весами, позволив им успешнее конкурировать с закрытыми проприетарными моделями от ведущих лабораторий, таких как Anthropic и OpenAI.



Оригинал материала: https://3dnews.ru/1148170