Muse Image это агентная картиночная модель: она не рисует по первому же прочтению промпта, а сначала разбирает задачу, планирует композицию и только потом отдаёт кадр. Внутри у неё отдельный рассуждающий слой, который пишет план картинки, при необходимости сверяется с внешним контекстом и раскладывает по местам объекты, персонажей и текст. У нас она стоит 3 токена за изображение и это самая дешёвая модель каталога.
Разница с одношаговыми моделями видна не на «нарисуй кота», а на промптах, где условий больше трёх и они спорят друг с другом. Там, где обычная модель тихо теряет половину требований, Muse Image держит их все, потому что успела разложить сцену до отрисовки. Плата за это временем: кадр приезжает за десятки секунд, а не за единицы.
| Тип | Изображения (Text-to-Image, Image-to-Image) |
| Цена | 3 токена за изображение |
| Скорость | Десятки секунд, дольше одношаговых моделей |
| Разрешение | Около 2.5 Мп в любой пропорции, параметра нет |
| Пропорции | Восемь вариантов от 21:9 до 9:16 или на усмотрение модели |
| Референсы | До 10 входных изображений |
| Промпт | До 20 000 символов |
Этот кадр сгенерирован одним запросом по брифу из восьми условий сразу: рассветный свет из окна слева, три буханки на деревянном подносе, пар от чашки справа, рыжий кот спит на подоконнике, меловая доска на стене с читаемым прайсом, мука в воздухе, тёплая приглушённая палитра, горизонтальный кадр. Соблюдены все восемь, включая надпись на доске. Генерация заняла 32 секунды.
Главные фичи: почему именно Muse Image?
Она думает до того, как рисует. Промпт сначала превращается во внутренний план кадра: что в центре, что на фоне, кто где стоит, что написано на вывеске. Одношаговая модель решает это по ходу отрисовки и на сложном описании начинает жертвовать деталями. Muse Image приходит к холсту с готовой раскладкой, поэтому длинные промпты с десятком условий у неё выживают целиком.
Она собирает кадр из множества референсов. Человек с одной фотографии, куртка со второй, интерьер с третьей, манера рисунка с четвёртой: модель разводит роли приложенных картинок и не сваливает их в кашу. Это та задача, на которой обычные модели тащат с референса всё подряд, включая композицию, которая вам не нужна.
Она правит без масок. Область правки описывается словами, пространственными отношениями: «убери со стола всё слева от чашки», «продли кадр вверх». Рисовать маску мышью не требуется, и это быстрее в работе. Второй кадр карусели выше показывает эту логику: слева заваленный стол, справа он же после словесной инструкции «убери всё со стола, оставь растение».
Она вторая в мире по человеческим оценкам. На публичных аренах Muse Image держит второе место в трёх зачётах: text-to-image, редактирование одной картинки и редактирование нескольких. Это оценки живых людей, а не автометрики, и по состоянию на начало июля 2026 выше неё стоит только одна модель.
Почему такая дешёвая модель так высоко стоит
Цена в 3 токена и второе место в мире выглядят несовместимо, но противоречия тут нет. Агентный подход экономит не вычисления на отрисовке, а попытки: модель реже промахивается мимо промпта, и вам не нужно перезапускать генерацию четыре раза, подкручивая формулировку. Дешёвая модель, в которую надо ткнуться пять раз, обходится дороже средней, которая попадает с первого.
Второе следствие того же устройства: кадр выходит ровным и предсказуемым. Это плюс, когда нужен управляемый результат, и минус, когда нужен неожиданный: рассуждающий слой тянет картинку к аккуратной, усреднённой подаче.
Когда выбирать Muse Image
- Промпт длинный и с условиями, которые надо соблюсти все сразу.
- Кадр собирается из нескольких референсов, и важно, что с какого взято.
- Нужна правка по словесному описанию, без возни с масками.
- Хочется предсказуемый результат с первой попытки, а не лотерею.
- Считаете расход: 3 токена это минимум по каталогу.
Когда лучше взять что-то другое
- Нужен ответ за секунды: возьмите Nano Banana 2 Lite, она отдаёт кадр примерно за 4 секунды.
- Нужен интерфейсный макет или таблица, где полтора десятка подписей стоят в строгой сетке: плакатный текст Muse Image держит, а сетку теряет, надёжнее Nano Banana Pro.
- Нужно 4K или сверхширокая панорама: кадр Muse Image всегда около 2.5 Мп, а пропорции ограничены восемью вариантами от 21:9 до 9:16.
- Нужен выраженный авторский стиль, а не аккуратная норма.
Сравнение с соседями по каталогу
| Модель | Цена | Скорость | Сильная сторона |
|---|---|---|---|
| Muse Image | 3 токена | Десятки секунд | Сложные промпты, сборка из референсов, правка словами |
| Nano Banana 2 Lite | 4 токена | Около 4 секунд | Скорость и цена на простых задачах |
| Nano Banana 2 | 8 токенов | Секунды | Разрешение до 4K, сверка фактов поиском |
| GPT Image 2 | Дороже | Секунды | Общее качество кадра |
По внутренним замерам разработчика Muse Image уступает GPT Image 2 в общем качестве, но обгоняет Nano Banana 2 в редактировании, и в одиночном, и в многокартиночном. Наши наблюдения это подтверждают: на «просто нарисуй» разница между моделями невелика, на «нарисуй по этим четырём картинкам и не потеряй ни одного условия» Muse Image отрывается.
Русский текст в кадре
Это первое, что стоит проверять на любой новой модели, и Muse Image проверку проходит. Кириллица ей даётся так же уверенно, как латиница: буквы не рассыпаются, слова не превращаются в похожий на русский орнамент, переносы стоят на месте.
Здесь в одном запросе четыре уровня кегля: крупный заголовок в две строки, подзаголовок с датами, список из трёх пунктов и мелкая нижняя строка. Ошибок нет ни в одной, включая нижнюю: «Вход свободный, регистрация на сайте» читается целиком. Модель сама подобрала гротеск, выстроила выключку по центру и добавила разделительную линию, о которой в промпте не просили.
Работает это так надёжно, потому что задача плакатная: текста немного, он крупный и лежит на ровной плашке. Как только надписей становится полтора десятка и они выстроены в плотную сетку, картина меняется, и об этом ниже в разделе про ограничения.
Правка фотографий с людьми
Отдельный разговор, потому что это самый частый запрос к редактированию и самый капризный: любая модель норовит вместе с фоном подменить и лицо. Muse Image держит внешность, если попросить её держать.
Слева исходный кадр, справа он же после одного запроса из четырёх правок: убрать со стола ключи и салфетку, заменить городскую улицу на закатную набережную с мостом, надеть на мужчину тёмно-синий пиджак поверх рубашки, привести свет к тёплому. И отдельным абзацем: лица, позы, мимику, причёски и ракурс не менять.
Все четыре правки выполнены, оба лица узнаются без оговорок, зелёный свитер остался прежним. Расплата за такую правку в том, что модель не вклеивает изменения в исходные пиксели, а перерисовывает кадр целиком: план стал теснее, крошки со стола исчезли заодно с салфеткой, надкус на круассане развернулся. Для соцсетей и презентации это незаметно, для работы, где важен исходный файл, держите оригинал под рукой.
Практический вывод: перечисляйте правки нумерованным списком и отдельно проговаривайте, что менять запрещено. Без второй половины модель считает себя вправе улучшить лицо.
Настройки запроса
Их три: промпт, референсы и соотношение сторон. Доступны восемь пропорций, от 21:9 до 9:16, и все они дают кадр одной площади, около 2.5 Мп: выбор задаёт форму кадра, а не его размер. Разрешение и формат вывода не настраиваются, это устройство модели.
По умолчанию стоит «Авто»: тогда модель выбирает форму сама, исходя из описания и пропорции приложенного референса. Формулировки в промпте она при этом понимает и учитывает при планировании композиции: «вертикальный кадр под телефон», «широкая панорама», «квадрат для аватара» работают и без явной настройки.
Сценарии использования
- Постер или обложка по подробному брифу. Когда в задаче десяток требований разом, это её профиль.
- Сборка персонажа из фотографий. Лицо с одной, одежда с другой, обстановка с третьей.
- Серия кадров в одном стиле. Приложите предыдущий кадр референсом и попросите взять с него манеру.
- Правка готового изображения словами. Убрать, добавить, продлить границы, поменять фон. Для фотографий с людьми смотрите раздел выше: внешность модель сохраняет, если это отдельно попросить.
- Черновики на объёме. При цене в 3 токена перебор вариантов обходится дешевле, чем на любой другой модели каталога.
Секреты промптинга
Пишите условиями, а не одной фразой. Модель разбирает промпт по пунктам, и структурированное описание она отрабатывает лучше сплошного предложения. Перечисление через запятую или с новой строки работает надёжнее, чем попытка уместить всё в одно длинное предложение.
Утренняя пекарня, рассветный свет из окна слева. Три буханки на деревянном подносе, от чашки справа идёт пар. Рыжий кот спит на подоконнике. На стене меловая доска, на ней читаемая надпись FRESH BREAD и три позиции с ценами. В воздухе видна мучная пыль. Тёплая приглушённая палитра, горизонтальный кадр.
Это и есть промпт первой картинки в статье. Обратите внимание: каждое условие живёт на своей строке, а не тонет в общем предложении.
Проговаривайте роль каждого референса. «С первой картинки возьми лицо, со второй одежду, с третьей только стиль рисунка»: модель разводит роли, если вы их назвали, и путает, если не назвали. Схема из карусели выше нарисована по такому промпту, с явно названными ролями четырёх источников.
Формат можно и не задавать. Соотношение сторон выбирается в настройках, но на «Авто» его понимают и слова в промпте: «вертикальный кадр», «широкая панорама», «квадрат для аватара».
Не экономьте на описании сцены. Верхняя граница промпта 20 000 символов, и это тот редкий случай, когда длинное описание улучшает результат, а не размывает его.
Русский текст пишите прямо в промпте. Кириллицу модель отрабатывает наравне с латиницей, поэтому надпись достаточно продиктовать дословно и указать, что она должна быть читаемой. Подставлять текст в редакторе после генерации обычно не требуется.
Ограничения
Плотная типографика в сетке. Плакат модель держит уверенно, в том числе на кириллице и мелким кеглем: пример выше. Ломается другое, макет, где надписей полтора десятка и каждая привязана к своей строке или ячейке.
Экран настроек на русском, четыре секции, около пятнадцати строк с заголовками и подписями. Сам текст читается почти весь, и это по-прежнему сильный результат для кириллицы такого размера. Но присмотритесь к правой колонке: переключатели съехали относительно своих строк, у одной строки тумблера нет, а иконка облака стоит напротив размера шрифта. Модель поняла смысл макета, но не удержала сетку. Для черновика годится, для сдачи макета нет.
Необычные ракурсы и позы. Резкая перспектива и нестандартная поза дают искажения чаще, чем на спокойных кадрах.
Групповые сцены. На кадрах с несколькими людьми иногда появляется лёгкая неестественность в лицах, которую замечаешь не сразу.
Усреднённая подача. Обратная сторона планирования: кадр выходит аккуратным, но без выраженного характера. Если нужен острый авторский стиль, задавайте его в промпте явно и подробно.
Скорость. Это самая медленная из недорогих моделей каталога. Планирование стоит времени, и на потоковых задачах, где важны секунды, она проигрывает.
FAQ
Почему нельзя выбрать разрешение?
У модели нет такого параметра: любая из восьми пропорций даёт кадр примерно в 2.5 Мп, от 1600×1600 до 2352×1008. Это устройство апстрима, а не ограничение нашего интерфейса. Соотношение сторон при этом выбирается свободно, а если оставить «Авто», модель определит форму кадра сама по описанию.
Сколько референсов можно приложить?
До 10 изображений в одном запросе. Роли референсов стоит проговорить в промпте, иначе модель решит сама.
Сколько картинок приходит за одну генерацию?
Одна, за несколькими вариантами запускайте несколько генераций.
Почему она медленнее других?
Потому что перед отрисовкой она строит план кадра. Это не задержка сети и не очередь, а сама работа модели, и именно за неё вы получаете точность на сложных промптах.
Она подходит для правки фотографий?
Да, и это одна из её сильных сторон. Правка описывается словами, маску рисовать не нужно.
Что делать, если текст в кадре поехал?
Увеличить кегль в задумке, попросить меньше надписей и больше места под них, либо взять модель, заточенную под типографику. Мелкий текст остаётся слабым местом.
Почему она дешевле остальных, если она вторая в мире?
Так устроена тарификация апстрима: у этой модели заметно ниже цена выходных токенов, чем у соседей по качеству. Мы передаём эту разницу в цене генерации.






