Tongyi-MAI · Apache 2.0
模型小,批次长

把手上所有提示词交给
Z-Image

Z-Image 是阿里 Tongyi-MAI 团队在 2025 年 11 月开源的文生图模型:60 亿参数、Apache 2.0 权重,蒸馏后的 Turbo 版只要 8 步就能出图。它在 BulkImagen 的价目表上排在最低那一档,所以批量 Z-Image 才值得认真铺开来跑。

每行一个,多行 = 多个提示词。

已输入 0 个提示词

Z-Image 只按提示词生成,因此没有参考图上传区。

QwenZ-Image
将生成 0 张图 · 消耗 0 积分

一个 60 亿参数的模型 凭什么进这份清单

Z-Image 不是 BulkImagen 上最大的模型,它也没打算是。它讲的是另一套逻辑:单位算力换回多少画面质量——这跟这里大多数模型的卖点不是一回事。

和大得多的权重同台比过

Z-Image Turbo 刚出来时,Artificial Analysis 的 Image Arena 上它是开源权重文生图模型里的第一名,排在 FLUX.2 [dev] 与 Qwen-Image 之前。Z-Image 的技术报告从另一头说了同一件事:用大约 FLUX.2 dev 320 亿参数五分之一的体量,拿到 87.4% 的 G+S Rate。

中英文字渲染有基准兜底

论文里数字最漂亮的部分就是文字:CVTG-2K 上单词准确率 0.8671,LongText-Bench 英文 0.935、中文 0.936,论文称超过 GPT-Image-1 与 Qwen-Image。如果这批图要带中文或英文文案,这组基准就是选 Z-Image 的理由。

写实,而且只走 8 步

Z-Image 的模型卡和论文都把照片级写实放在最前面,而蒸馏后的 Turbo 权重只用 8 步采样就能到那个程度,不是常见的几十步。开源版能塞进 16GB 显存的卡,但这一页不要求你有卡——跑批在我们这边。

Z-Image 在这里的实际配置

画面比例、分辨率档、提示词长度上限、每张图的积分,都是从线上配置读出来的,不写进这段文字里——写进来,改了配置它就慢慢变成假话了。

Qwen

Z-Image

厂商
Alibaba
积分 / 张
1
分辨率
1K
可选比例
5
参考图
仅文生图
提示词上限
1,000 字符

「不支持参考图」是 Z-Image 的真实能力,不是漏配。下面的常见问题里说清楚了这对排批次意味着什么。

三步,而且不用 准备参考图

Z-Image 只读文字,别的都不读,所以这一页的流程比那些靠参考图驱动的模型页短:写清楚、定画幅、收结果。

  1. 01

    全部写进提示词里

    它没有图像输入,所以你在意的每个细节都得落在文字上。论文也直说了:60 亿参数换来的效率,代价是世界知识有限,所以冷门的人、地点、品牌最好直接描述外观,别指望模型认得这个名字。

  2. 02

    定画幅和数量

    本页锁定 Z-Image,而它只有一个分辨率档,所以表单上要设的就两样:比例,以及每条提示词出几张。确认页会在第一次调用发出前把总积分算清楚。

  3. 03

    快速过一遍再导出

    结果陆续填进来。Z-Image Turbo 的模型卡把输出多样性标为 Low,所以如果几行结果长得几乎一样,多半是提示词写得太接近了——改措辞,而不是把同一句再抽一次。

哪些批次 适合这个模型

又小又快、文字又强的模型,是有它自己的形状的。下面这几类活是顺着这个形状来的,不是跟它拧着来。

带真实文案的海报和 UI 稿

带中文或英文字的版面,正是 Z-Image 那组基准所围绕的场景。一次把整套页面或海报变体跑出来,再逐张看文字对不对,然后再决定用哪一版。

成批的写实人物与场景

写实是 Tongyi-MAI 主推 Z-Image 的点,量则是这一页补上的。生活场景、类图库画面、背景板,回来的是一整组可以挑的图,而不是一张一张精修出来的成片。

本来就在跑开源权重的团队

如果你本地已经把 Z-Image 拉下来了,这里是同一个家族,只是前面没有排队的 GPU。先在托管的 Turbo 版上把提示词集打磨、筛选好,再把入围的那几条拿回自己的环境跑。

Z-Image 常见问题

还有别的问题?邮件联系 support@bulkimagen.com

  • 阿里巴巴旗下的 Tongyi-MAI 团队,和 Qwen 团队、Wan 团队都是分开的。Z-Image Turbo 于 2025 年 11 月 26 日开源发布,技术报告在次月挂上 arXiv。
  • 是。Z-Image 的权重以 Apache 2.0 许可发布在 HuggingFace、ModelScope 和 GitHub 上,以这个质量档位的模型来说算相当宽松的许可。用这一页只是省掉你自己部署那一步。
  • 蒸馏后的 Turbo 版。正是蒸馏把 Z-Image 压到 8 步采样;代价模型卡也写明了:Turbo 不接受 guidance 参数,也不是拿来做微调的。
  • 不能,而且是在扣积分之前就拦下来,不是扣完才失败。Z-Image 公开的推理接口只收提示词、尺寸、步数和随机种子,里面根本没有图像输入这一项。带参考图与编辑能力的 Z-Image-Edit 是另外单独训练的模型,截至 2026 年 8 月仍标着 Coming Soon。
  • 按论文报告的基准,以它的体量来说算好:CVTG-2K 单词准确率 0.8671,LongText-Bench 英文 0.935、中文 0.936。这些是论文里的数字,真正算数的还是拿你自己的文案先跑一小批看看。
  • Z-Image 是中英双语训练的,LongText-Bench 上中文分数和英文基本持平,所以中文提示词在这里是原生输入,不是「英文模型外面套层翻译」。
  • 论文自己写得很直白:60 亿参数买到的是效率,代价是世界知识有限,冷门人物、地点和品牌细节都不稳。模型卡另外把 Turbo 的输出多样性标为 Low,表现出来就是措辞接近的几条提示词,出图也会很像。
  • Nano Banana Pro、Flux 2 Pro 这类闭源旗舰在分辨率上限、细节还原和参考图一致性上走得更远。Z-Image 把这些让出去,换的是单张成本——所以清单一长,它就是该被想起来的那个。
  • 小模型加蒸馏,服务成本本来就最低,于是 Z-Image 落在上面积分表的最底下那一格。同样一批图,放在旗舰模型上要先谈预算,放在这里就只是跑一批而已。
  • CSV 和 Excel 都可以,提示词那一列就是这个 Z-Image 批次的每一行。清单本来就在表格里的时候特别省事,不然光重新敲一遍就是最慢的一步。
  • 在结果页里勾出值得留的图,把这份选择打包成一个 ZIP 下载。没勾的原样留着,没跑好的那几条也可以单独再发一次。

把长清单交给 Z-Image

平台上最便宜的一档、有公开中英文字基准的模型,而且不用事先准备参考图。粘贴提示词,一个批次跑完,把 ZIP 带走。