The Verge · Разработка · 1 ч назад

Почему еда ИИ выглядит так

Из ресторанов, кафе и брендов, которые все чаще обращаются к искусственному интеллекту для создания изображений, рекламирующих свою еду, льется поток неаппетитной помои. Получившееся шоу ужасов включает в себя пончики с креветками, Рубенса из глубины, червеобразную лапшу, выпечку, похожую на лапшу, и жилистую курицу. Есть также строительные материалы, маскирующиеся под мороженое, мороженое, маскирующееся под мозги, и…

Источник The Verge
Опубликовано 1 ч назад
Оригинальный заголовок Why AI food looks like that
Важность 3/5
Почему это может быть интересно Может дать практические идеи для backend, инфраструктуры, инструментов и инженерных решений.
← Назад к ленте Открыть оригинал
#technology#software#platforms#разработка

Подробности

Из ресторанов, кафе и брендов, которые все чаще обращаются к искусственному интеллекту для создания изображений, рекламирующих свою еду, льется поток неаппетитной помои. Получившееся шоу ужасов включает в себя пончики с креветками, Рубенса из глубин, червеобразную лапшу, выпечку, похожую на лапшу, и жилистую курицу. Есть также строительный материал, маскирующийся под мороженое, мороженое, маскирующееся под мозги, и другая кухня, примыкающая к каменной кладке. Я даже не знаю, как начать описывать эту чудовищную попытку съесть гамбургер, и чем меньше будет сказано о адском трипофобном буррито, личинках и всем остальном, тем лучше. Есть комочки. И дырки. Столько дыр.

«Модели диффузии общеизвестно слабы в создании тонких, непрерывных, завершающихся структур».

Обычно мы не понимаем, зачем кому-то использовать помои ИИ, чтобы продать что-то, что должно выглядеть аппетитно, особенно когда еда, по-видимому, находится прямо здесь, чтобы ее можно было сфотографировать. Но мы кое-что знаем о том, почему ИИ настолько искусен в создании таких отвратительных изображений.

Есть много причин, почему эта пища ИИ настолько неправильна: от технических нюансов того, как системы ИИ генерируют изображения и материалов, используемых для их обучения, до психологического багажа, через который люди воспринимают изображения. Часто проблема начинается с самого начала. Многие из ведущих генераторов изображений создают изображения с использованием диффузии. Проще говоря, диффузионные модели начинаются с изображения чистого шума — что-то вроде статического экрана — и постепенно постепенно удаляют шум, чтобы создать требуемый визуальный эффект. «Это означает, что сначала восстанавливаются грубые структуры, а в конце — мелкие детали текстуры», — объяснил Крис Рассел, профессор кафедры искусственного интеллекта, государственного управления и политики в Оксфордском университете и эксперт в области компьютерного зрения.

Рассел сказал, что во многих из этих тревожных изображений еды все уже пошло не так, когда были добавлены эти более мелкие детали. Модель может неправильно определить базовую структуру объекта на более раннем этапе, а затем насыпать поверх этой структуры яркие детали текстуры. «Это та же самая неудача, которую вы видите, когда у человека шесть пальцев вместо пяти», — сказал Рассел. (Это также может объяснить появление креветок-пончиков.)