
Как нейросети редактируют фотографии: большой разбор inpainting, image-to-image и диффузии. Часть 1
Двадцать лет назад убрать мусорный бак из кадра — это была целая история, требующая виртуозно владеть фотошопом. Чем дальше шло развитие «умных» инструментов, тем проще решалась эта задача, но поведение всё же не было до конца предсказуемым.И вот мы пришли к полноценному ИИ, который нам этот бак уберёт одним щелчком, не обязательно даже его полностью выделять. Так и хочется сказать: «Будущее!» А потом заметить, что заодно перерисовался бордюр в другом конце кадра. Который вообще не надо было трогать.В этом небольшом цикле статей мы поговорим об обработке настоящих, реальных фотографий с помощью ИИ. И нет, это не будет сборник типа «десять нейросетей для фотографа». Мы с вами полезем куда глубже, в самые основы, чтобы понять, как именно нейронка (а точнее, диффузионка) видит и обрабатывает фото.Разговор пойдёт по нарастающей. Сначала пройдёмся по методам ретуши. Потом погрузимся в то, как диффузионка вообще работает с картинкой — целиком, от промпта до пикселей. Потом — как из такой генерации сделали редактор. Дальше — что модель несёт с собой из обучения, что ломается на стыке с фотографическим рабочим процессом, что до сих пор быстрее делать по-старому. И под конец — вопрос про то, чему теперь вообще верить, мы его затронем по касательной.Предупреждаю сразу: примерно две трети текста — это про ограничения. Про достоинства вам и без меня расскажут в любом рекламном ролике, а вот про то, где именно эта штука спотыкается, обычно молчат. Читать далее