Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных

Учёные Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) при Массачусетском технологическом институте доказали, что по мере роста наборов данных связь между тем, чему учится модель, и тем, что она генерирует, практически исчезает. Это указывает на необоснованность претензий правообладателей к лабораториям ИИ.

 Источник изображения: news.mit.edu

Источник изображения: news.mit.edu

Американские учёные открыли явление «затухания атрибуции» (attribution decay), при котором чем больше данных используется при обучении генеративной модели искусственного интеллекта, тем меньшее значение имеет любой конкретный элемент в обучающем массиве для любого конкретного результата генерации. При достаточно больших масштабах можно вообще удалить из обучающих данных любое отдельное изображение, все изображения определённого художника или все фотографии определённого человека, и сгенерированная моделью картинка не изменится.

Доказать это на практике было непросто. В общем случае, чтобы узнать, каков был бы ответ модели на конкретный запрос, если бы она никогда не видела определённое изображение, потребовались бы обучить точно такую же модель без этого изображения и повторить опыт; а затем повторить всё сначала для следующего изображения в обучающем массиве. Поэтому учёные предложили альтернативное решение — созданную ими самостоятельно архитектуру «диффузионного ансамбля» (diffusion ensemble). Это не единая монолитная модель, а множество мелких компонентов, каждый из которых обучен на отдельном фрагменте данных. В этом случае, чтобы узнать, как бы модель работала без конкретного изображения в обучающих данных, достаточно отключить те части ансамбля, которые его видели. Результаты работы этой системы сравнивались с результатами ответов 24 обычных диффузионных моделей, обученных на тех же данных. Изображения получились одинаково хорошими по стандартным показателям.

Учёные пришли к выводу, что чем больше объёмы обучающих данных, тем лучше ансамбли показывают себя по сравнению с аналогами на основе одной модели. В ходе анализа они отправляли группе моделей один запрос, удаляли из обучающих данных по одному изображению и сравнивали расхождение результатов. На основе эксперимента они ввели понятие «контрфактического радиуса» (counterfactual radius) — максимального влияния, которое мог оказывать отдельный элемент в обучающем массиве. В результате исследователи установили закономерность: чем больше обучающий набор данных, тем меньше контрфактический радиус. Другими словами, тем меньше влияние любого конкретного элемента. Результаты сравнивались как попиксельно, так и по общему семантическому значению.

В юридическом аспекте открытие означает, что ИИ-модели демонстрируют по-настоящему творческий подход — они не копируют материалы из исходных данных, а создают совершенно новые результаты. И если эти результаты не имеют ничего общего с отдельными элементами из обучающего массива, то использование контента, даже защищённого авторским правом, является добросовестным даже без обращения к правообладателю. На языковых моделях этот подход пока не проверяли.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Пентагон получил собственные версии ChatGPT и Grok 51 мин.
Google начала навязывать ИИ-режим в поиске — некоторые развёрнутые ответы от ИИ теперь показываются автоматически 6 ч.
Календарь релизов — 31 августа – 6 сентября: The Blood of Dawnwalker, Onimusha и Serious Sam 7 ч.
Балканизация виртуализации: VMware теряет клиентов из-за стратегии Broadcom, но та не собирается ничего менять 7 ч.
Недавнее обновление для Windows 11 сломало курсор и обои рабочего стола 7 ч.
Отличная RPG, которая могла стать великой: критики вынесли вердикт The Blood of Dawnwalker 10 ч.
DLSS 5 заработала на видеокартах GeForce RTX 2000 и RTX 3000, но очень медленно 12 ч.
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 12 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 12 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 13 ч.
Новая статья: 10 флагманских процессоров Intel за 10 лет 6 ч.
AOC выпустила 27-дюймовый игровой монитор Agon AGP277KXM с подсветкой Mini-LED и двумя режимами: 5K@180 Гц и 1440p@360 Гц 6 ч.
Apple потеряла ключевого руководителя накануне смены гендира: Фил Шиллер оставил пост главы App Store 7 ч.
Тим Кук эмоционально обратился к сотрудникам Apple в свой последний день на посту генерального директора 10 ч.
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 11 ч.
CXMT запустила пробное производство памяти HBM3E 11 ч.
В недрах Марса обнаружилась массивная «тепловая аномалия» — возможно, это результат древнего космического ДТП 12 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 13 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 14 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 14 ч.