Z-Image 不是 BulkImagen 上最大的模型,它也没打算是。它讲的是另一套逻辑:单位算力换回多少画面质量——这跟这里大多数模型的卖点不是一回事。
Z-Image Turbo 刚出来时,Artificial Analysis 的 Image Arena 上它是开源权重文生图模型里的第一名,排在 FLUX.2 [dev] 与 Qwen-Image 之前。Z-Image 的技术报告从另一头说了同一件事:用大约 FLUX.2 dev 320 亿参数五分之一的体量,拿到 87.4% 的 G+S Rate。
论文里数字最漂亮的部分就是文字:CVTG-2K 上单词准确率 0.8671,LongText-Bench 英文 0.935、中文 0.936,论文称超过 GPT-Image-1 与 Qwen-Image。如果这批图要带中文或英文文案,这组基准就是选 Z-Image 的理由。
Z-Image 的模型卡和论文都把照片级写实放在最前面,而蒸馏后的 Turbo 权重只用 8 步采样就能到那个程度,不是常见的几十步。开源版能塞进 16GB 显存的卡,但这一页不要求你有卡——跑批在我们这边。
画面比例、分辨率档、提示词长度上限、每张图的积分,都是从线上配置读出来的,不写进这段文字里——写进来,改了配置它就慢慢变成假话了。
「不支持参考图」是 Z-Image 的真实能力,不是漏配。下面的常见问题里说清楚了这对排批次意味着什么。
Z-Image 只读文字,别的都不读,所以这一页的流程比那些靠参考图驱动的模型页短:写清楚、定画幅、收结果。
它没有图像输入,所以你在意的每个细节都得落在文字上。论文也直说了:60 亿参数换来的效率,代价是世界知识有限,所以冷门的人、地点、品牌最好直接描述外观,别指望模型认得这个名字。
本页锁定 Z-Image,而它只有一个分辨率档,所以表单上要设的就两样:比例,以及每条提示词出几张。确认页会在第一次调用发出前把总积分算清楚。
结果陆续填进来。Z-Image Turbo 的模型卡把输出多样性标为 Low,所以如果几行结果长得几乎一样,多半是提示词写得太接近了——改措辞,而不是把同一句再抽一次。
又小又快、文字又强的模型,是有它自己的形状的。下面这几类活是顺着这个形状来的,不是跟它拧着来。
带中文或英文字的版面,正是 Z-Image 那组基准所围绕的场景。一次把整套页面或海报变体跑出来,再逐张看文字对不对,然后再决定用哪一版。
写实是 Tongyi-MAI 主推 Z-Image 的点,量则是这一页补上的。生活场景、类图库画面、背景板,回来的是一整组可以挑的图,而不是一张一张精修出来的成片。
如果你本地已经把 Z-Image 拉下来了,这里是同一个家族,只是前面没有排队的 GPU。先在托管的 Turbo 版上把提示词集打磨、筛选好,再把入围的那几条拿回自己的环境跑。
还有别的问题?邮件联系 support@bulkimagen.com
平台上最便宜的一档、有公开中英文字基准的模型,而且不用事先准备参考图。粘贴提示词,一个批次跑完,把 ZIP 带走。