Промпт на 4500 токенов вместо тысячи
Прежняя версия, Qwen-Image 2.0, принимала подписи максимум на тысячу токенов. Qwen-Image-3.0 увеличила лимит в 4,5 раза, и это не просто техническая деталь. С длинным промптом модель собирает композиции, которые раньше требовали склейки нескольких картинок. Витринный пример команды Qwen — сетка три на три с девятью разными иллюстрациями (диаграмма по физике, доказательство из теории групп, разбор по биологии и ещё шесть), собранная из одной инструкции на 3700 токенов. Второй пример — вложенные интерфейсы: редактор кода, внутри которого открыто окно чата, а внутри чата — мессенджер.
Текст размером в десять пикселей
Вторая заявленная сильная сторона — мелкая деталь. Alibaba утверждает, что модель читаемо рендерит текст высотой всего десять пикселей и воспроизводит фактуру кожи, волос и бумаги почти на уровне фотографии. В галерее релиза — разворот академической статьи с многострочными формулами, макет газетной полосы, добавление рукописных пометок на готовое изображение и реставрация повреждённой картины в традиционной технике.
Модель, которая подглядывает в прогноз погоды
Третий блок команда называет «мировыми знаниями»: нативный рендеринг на 12 языках и больше чем 20 шрифтов, воспроизведение интерфейсов вроде веб-страниц и трансляций, и способность подтягивать актуальные данные из сети прямо в изображение. Пример из презентации — график прогноза погоды для конкретного города на конкретную дату. Для генератора картинок это необычная претензия: модель здесь работает не только с формой, но и с содержанием, которое само по себе должно быть верным.
Газетные полосы, сторибоарды, карточки товаров
Alibaba целится в контент-продакшен: вёрстку новостных полос, сторибоарды для короткометражных драм, макеты интерфейсов, карточки для маркетплейсов. Ровно тот сегмент, где вопрос о раскрытии участия ИИ в производстве материала уже не абстрактный, а рабочий — редакции и агентства такие изображения публикуют массово. Обе стороны примеров команда выбирала сама, и удобство для конкретной задачи ещё предстоит проверить на чужих промптах, а не на витринных.
Ни весов, ни отчёта, ни лицензии
Пост о релизе не содержит таблицы с бенчмарками, числа параметров, лицензии и технического отчёта о том, как модель обучали и тестировали. Попробовать её можно только через Qwen Chat. Это разворот на 180 градусов относительно того, как серия выходила раньше. Qwen-Image 1.0 в августе 2025 года вышла сразу с открытыми весами под лицензией Apache 2.0 и техническим отчётом день в день. У Qwen-Image 2.0 был собственный технический отчёт, и там же фигурировал прежний лимит в тысячу токенов — единственная цифра из старого релиза, с которой теперь можно сравнить новую. Для генератора изображений закрытость обиднее, чем для текстовой модели: качество тут субъективно, а рендеринг текста — как раз то направление, где демо на подобранных примерах обычно выглядит сильнее, чем модель под системным тестированием.
Пятое место как точка отсчёта
У Alibaba есть собственный ориентир, откуда считать прогресс. В бенчмарке Qwen-Image-Bench, который команда Qwen опубликовала сама, предыдущий флагман Qwen Image 2.0 Pro занял пятое место. Первую строчку держит GPT Image 2 от OpenAI, следом идут модели Nano Banana от Google и GPT Image 1.5. Оценка построена на модели-судье, которая, по словам авторов бенчмарка, хорошо совпадает с оценками живых людей, но тест всё равно собственный, а мерили им прошлое поколение, а не 3.0.
Пятое место — не худший старт, но и не тот, с которого закрытые бенчмарки выглядят убедительно. Заявка на скачок есть, а способа её проверить со стороны — нет.
Tencent и Thinking Machines показывают, что закрытость — выбор
Конкуренты в те же недели поступили иначе. Tencent выпустила HunyuanImage 3.0 с открытыми весами, а Thinking Machines Lab свою первую мультимодальную модель Inkling тоже отдала с весами в комплекте. На этом фоне решение Qwen читается не как техническое ограничение, а как коммерческий расчёт: пока конкуренты делятся моделями, Alibaba бережёт свежий релиз для собственного чат-продукта. Судить, оправдан ли скачок с тысячи до 4500 токенов и заявленная читаемость десятипиксельного текста, можно будет только по одному признаку — появятся ли веса, карточка модели и независимые тесты. До этого момента у разработчиков есть только подборка картинок, которую выбрала сама компания.