Сегодня 05 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

DeepSeek научилась тренировать языковые ИИ-модели без оглядки на ограничения по скорости памяти

Как отмечалось недавно, пропускная способность памяти, используемой в инфраструктуре ИИ, становится одним из серьёзных ограничителей дальнейшего роста быстродействия языковых моделей. Представители DeepSeek утверждают, что разработали метод обучения ИИ-моделей, который позволяет обойти подобные ограничения со стороны памяти.

 Источник изображения: Unsplash, Solen Feyissa

Источник изображения: Unsplash, Solen Feyissa

Группа исследователей Пекинского университета в сотрудничестве с одним из основателей DeepSeek Лян Вэньфэном (Liang Wenfeng) опубликовала научную работу, в которой рассматривается новый подход к обучению языковых моделей, позволяющий «агрессивно увеличивать количество параметров» в обход ограничений, накладываемых подсистемой памяти используемых в ускорителях GPU.

От DeepSeek ожидают выхода новой версии большой языковой модели, но ритмичность их создания в случае с китайскими разработчиками сильно страдает от экспортных ограничений США и нехватки ресурсов в Китае. Текст нового исследования, соавтором которого является один из основателей DeepSeek, будет подробно изучаться специалистами в области искусственного интеллекта как в Китае, так и за его пределами.

Описываемая в документе методика «условного» использования памяти получила обозначение Engram, как отмечает South China Morning Post. Существующие подходы к вычислениям при обучении больших языковых моделей, по мнению китайских исследователей, вынуждают напрасно тратить ресурсы на тривиальные операции, которые можно было бы высвободить для высокоуровневых операций, связанных с рассуждениями.

Исследователи предложили в некотором смысле разделить вычисления и работу с памятью, обеспечивая поиск базовой информации более эффективными способами. Одновременно новая технология позволяет большим языковым моделям лучше обрабатывать длинные цепочки контекста, что приближает цель превращения ИИ-агентов в полноценных помощников человека.

В рамках эксперимента новый подход при обучении модели с 27 млрд параметров позволил поднять общий уровень быстродействия на несколько процентов. Кроме того, система получила больше доступных ресурсов для осуществления сложных операций с рассуждениями. По мнению авторов исследования, данный подход будет незаменим при обучении языковых моделей нового поколения в условиях ограниченности ресурсов. По данным The Information, китайская компания DeepSeek намеревается представить новую модель V4 с развитыми способностями в области написания программного кода к середине февраля этого года.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 8 ч.
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 9 ч.
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 9 ч.
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 10 ч.
С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды 11 ч.
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 13 ч.
Nintendo анонсировала сразу две игровые презентации Nintendo Direct — обе пройдут на следующей неделе 14 ч.
Патчи для Heroes of Might & Magic: Olden Era станут выходить чаще — разработчики готовят два крупных обновления 15 ч.
AMD выпустила драйвер с поддержкой Onimusha: Way of the Sword и The Blood of Dawnwalker 16 ч.
ИИ-агенты OpenAI захватили немецкий сайт и превратили его в подпольный форум для ИИ 16 ч.
Разочарование инвесторов организацией дебюта Tesla Cybercab привело к снижению курса акций компании на 6 % 39 мин.
IPO компании Anthropic состоится не ранее середины октября 2 ч.
Apple за ближайшие до 2028 года включительно выпустит более 10 новых моделей iPhone 3 ч.
Больше инвестиций — ниже тарифы: США будут оказывать давление на поставщиков полупроводниковых компонентов 8 ч.
DLSS 5 портировали на видеокарты Radeon RX 9000 — производительность пока оставляет желать лучшего 8 ч.
Дефицит и рост цен не отпугнули покупателей видеокарт — продажи выросли на 14 % 11 ч.
Представлен защищённый ноутбук Oukitel RG14-P с солнечной батареей в крышке 11 ч.
CXMT удвоит мощности по выпуску памяти, но приблизиться к Samsung и SK Hynix ей не светит 11 ч.
Из-за подорожания компонентов ноутбук за $900 теперь должен стоить $1600 13 ч.
Из-за реформы лицензирования связи в России могут исчезнуть несколько тысяч малых интернет-провайдеров 13 ч.