Potion of Intelligence
Несколько дней назад вышла модель Google Nano Banana Pro и она преодолела важный рубеж в генеративном ИИ для картинок. Теперь у каждого есть доступный 24 на 7 друг, хорошо владеющий Photoshop. Убрать бывшего с совместной фотографии, аккуратно перевести все надписи на картинке с английского на русский, подделать рукописный текст — Nano Banana Pro делает это с одной попытки по простому текстовому запросу.
Картиночные ИИ за три с половиной года проделали огромный путь. Летом 2022 лучшие модели рисовали квадратные картинки 512 на 512 пикселей. И чтобы нарисовать что-нибудь простое, вроде панды на скейте, требовались десятки попыток. А о сложных сценах не могло быть и речи.
В 2023 картиночные ИИ научились рисовать красиво и в большом разрешении, но все ещё оставались «тупыми». Потому это всё ещё были именно отдельные картиночные ИИ. Например, у Open AI была «умная» языковая модель ChatGPT и к ней была прикручена «тупая» рисующая модель DALL-E. Когда пользователь просил ChatGPT нарисовать картинку, под капотом «умный» ChatGPT передавал запрос в «тупой» DALL-E, который был узким местом. Сложные сцены, надписи, замены отдельных объектов, всё это было пока невозможно: ChatGPT понимал что от него хотят, но «объяснить» это DALL-E он не мог.
В 2024 году картиночные модели стали заметно умнее, а также их начали специально натаскивать на задачи вроде добавления надписей. Но это всё ещё были отдельные картиночные модели. Между ними и текстовыми моделями по интеллекту все ещё была пропасть.
Наконец, в начале 2025 года ChatGPT стал по-настоящему мультимодальным: он больше не передаёт запросы в DALL-E текстом, он объединён с DALL-E в единую сущность. В теории ChatGPT теперь может нарисовать всё, что он способен описать текстом. На практике, однако, остаются проблемы.
Например, ChatGPT редко удается нарисовать циферблат аналоговых часов со временем, отличным от 10:10. Текстом он может правильно объяснить, как должны располагаться стрелки, когда часы показывают, скажем, 17:20. Но при попытке их нарисовать получается 10:10, потому что именно такие изображения доминировали в тренировочном датасете. ChatGPT сам видит ошибку, но исправить её не получается. Мне это напоминает ситуацию, когда я неправильно выучиваю музыкальный фрагмент на фортепиано. Пальцы запоминают неправильное ноты, потом мозг пытается заставить пальцы играть иначе, но они играют по привычке.
Другая проблема ChatGPT — он всегда перерисовывает картинку целиком. Даже когда просишь изменить одну деталь. В середине 2025 года Google и Alibaba выкатили мультимодальные Nano Banana и Qwen Image Edit, которые были лишены этого недостатка. От них уже можно было добиться почти любого результата. Но иногда это требовало много итераций. И обе модели всё ещё плохо рисовали кириллицу.
Вышедшая неделю назад Nano Banana Pro умеет делать всё и с первого раза. Вероятно, она научилась разбивать запрос на этапы и контролировать каждый этап. Например, чтобы заменить надписи с английского на русский, по идее их надо сперва стереть и заполнить пустоты под ними. Потом приготовить русский перевод. Запомнить шрифт. Написать этим шрифтом русский текст. Следить чтобы он влез по ширине и высоте. Не знаю как именно работает Nano Banana Pro, но она с этим справляется в один заход.
С моей точки зрения, рисование и редактирование картинок в первом приближении решены. Развиваться ещё есть куда. Хочется меньше артефактов, больше консистентности. Midjourney хоть и «тупее» на несколько поколений, но до сих пор рисует красивее и эстетичнее. Однако в целом — всё что мне приходит в голову, Nano Banana Pro уже делает. Все реальные задачи она покрывает.
5 · 421 ·