Может ли ИИ уничтожить сам себя? Новое исследование отвечает утвердительно

Результаты исследований Университета Райса показывают, что повторяющееся обучение синтетических данных может привести к "расстройству аутофагии моделей", что ухудшает качество генеративных моделей ИИ.

Генеративные модели искусственного интеллекта, такие как GPT-4 от OpenAI или Stable Diffusion от Stability AI, отлично справляются с созданием текста, кода, изображений и видео. Но их обучение требует огромных объёмов данных, и разработчики уже сталкиваются с проблемами в обеспечении этих ресурсов, что может в скором времени привести к их дефициту.

В условиях недостатка данных идея использования синтетических данных для обучения ИИ становится всё более привлекательной для крупных технологических компаний. Синтезированные данные обходятся дешевле, их можно производить в неограниченных количествах, они представляют меньшие риски для конфиденциальности, например, в медицине, и иногда могут даже улучшить работу моделей.

Но недавнее исследование из Университета Райса выявило, что чрезмерное использование синтетических данных может привести к серьёзным проблемам в развитии будущих поколений ИИ.

Ричард Баранюк, профессор из Университета Райса, объясняет:

Когда синтетические данные используются повторно, возникает своеобразная петля обратной связи, или, как мы это называем, "самопожирающая" петля. Мы много исследовали такие петли и обнаружили, что после нескольких циклов обучения новые модели могут оказаться серьёзно поврежденными. Это явление иногда называют "коллапсом модели", но нам кажется, что термин "расстройство аутофагии модели" (MAD) более точен, по аналогии с коровьим бешенством.

Коровье бешенство — это смертельное заболевание, передающееся через заражённое мясо. Вспышка этого заболевания в 1980-90-х годах была связана с тем, что коров кормили переработанными остатками их же сородичей, отсюда и термин "аутофагия", что в переводе с греческого означает "самоедение".

Исследование под названием "Самопожирающие генеративные модели сходят с ума" стало первым рецензируемым исследованием феномена аутофагии в ИИ и сосредоточено на генеративных моделях, таких как DALL·E 3, Midjourney и Stable Diffusion.

Может ли ИИ уничтожить сам себя? Новое исследование отвечает утвердительно

Источник: Digital Signal Processing Group/Rice University.

В этом примере исследователи обучили последовательность генеративных моделей StyleGAN-2, используя полностью синтетические данные. Каждый из шести столбцов изображений отображает пару примеров, сгенерированных моделью первого, третьего, пятого и девятого поколения соответственно. С каждой итерацией цикла заштрихованные артефакты постепенно усиливаются.

Поскольку интернет является основным источником данных для обучения генеративных моделей, распространение синтетических данных в сети будет создавать самопожирающие циклы с каждым новым поколением моделей. Баранюк и его команда изучили три сценария таких циклов:

  1. Полностью синтетический цикл: каждое новое поколение модели обучается на полностью синтетических данных, созданных предыдущими поколениями.
  2. Синтетический цикл с дополнением: модель обучается на смеси синтетических данных и фиксированного набора реальных данных.
  3. Цикл свежих данных: каждое новое поколение модели использует смесь синтетических данных и нового набора реальных данных.

Результаты показали, что без достаточного количества свежих данных модели начинают выдавать всё более искажённые результаты, теряя в качестве и разнообразии. Это означает, что чем больше свежих данных, тем стабильнее и здоровее развивается ИИ.

Сравнение наборов данных, созданных последующими поколениями моделей, показало мрачную картину: изображения человеческих лиц всё больше покрываются странными «шрамами» — так называемыми генеративными артефактами, или начинают напоминать одного и того же человека. Числа в наборах данных превращаются в неразборчивые каракули.

Чтобы сделать исследование более реалистичным, учёные добавили параметр смещения выборки, который учитывает тенденцию пользователей выбирать качество данных, жертвуя их разнообразием. Это приводит к тому, что качество сохраняется дольше, но разнообразие сокращается ещё быстрее.

Если этот процесс не контролировать, MAD может привести к тому, что качество и разнообразие данных в интернете серьёзно пострадают. Даже если этого не случится, неизбежно возникнут другие непредсказуемые последствия от аутофагии ИИ в ближайшем будущем.

Читайте также

США и Google вложат почти 1,8 млрд долларов в создание «виртуальных клеток»

США и Google вложат почти 1,8 млрд долларов в создание «виртуальных клеток»

Google открыла SynthID для всех — сервис помогает распознавать изображения и видео, созданные ИИ

Google открыла SynthID для всех — сервис помогает распознавать изображения и видео, созданные ИИ

Kawasaki оснастит человекоподобного робота Kaleido физическим ИИ для работы на заводах

Kawasaki оснастит человекоподобного робота Kaleido физическим ИИ для работы на заводах

В Германии создают строительных роботов, способных собирать здания почти без участия человека

В Германии создают строительных роботов, способных собирать здания почти без участия человека

Видеоаналитика на базе ИИ позволила найти 250 детей в Новосибирской области

Видеоаналитика на базе ИИ позволила найти 250 детей в Новосибирской области

Ученые МИСИС создали пористые гранулы для костей с защитой от инфекций

Ученые МИСИС создали пористые гранулы для костей с защитой от инфекций

В Казахстане кошек с камерами и ИИ отправили искать пропавших питомцев

В Казахстане кошек с камерами и ИИ отправили искать пропавших питомцев

Ученые выяснили, насколько Германия была близка к запуску ядерного реактора B8 во время Второй мировой войны

Ученые выяснили, насколько Германия была близка к запуску ядерного реактора B8 во время Второй мировой войны

Из лабораторий — на работу: 7 компаний, создающих человекоподобных роботов для реального мира

Из лабораторий — на работу: 7 компаний, создающих человекоподобных роботов для реального мира

Почему роботы умеют делать сальто, но до сих пор не могут нормально сложить рубашку

Почему роботы умеют делать сальто, но до сих пор не могут нормально сложить рубашку

Почему невозможно создать абсолютно точную карту Земли, Луны или Марса?

Почему невозможно создать абсолютно точную карту Земли, Луны или Марса?

Первый складной iPhone не стал революцией: с чем придется мириться владельцам iPhone Duo

Первый складной iPhone не стал революцией: с чем придется мириться владельцам iPhone Duo

Что происходит с физикой, когда вы прыгаете в вагоне поезда?

Что происходит с физикой, когда вы прыгаете в вагоне поезда?

Частицы топлива из Чернобыля сохранили структуру спустя 40 лет после аварии

Частицы топлива из Чернобыля сохранили структуру спустя 40 лет после аварии

Кастрюлю Star Trek отправили на высоту 35 км — почти к границе космоса

Кастрюлю Star Trek отправили на высоту 35 км — почти к границе космоса

Microsoft и NVIDIA представили RTX Spark и Surface Laptop Ultra с упором на локальный ИИ

Microsoft и NVIDIA представили RTX Spark и Surface Laptop Ultra с упором на локальный ИИ