做公众号封面的人,大概都碰过这种事。
第一张图方向对了,人物姿态也差不多,标题位置却挤在角落。改完标题,背景又不适合放字。把人物抠出来想另做一版,边缘留下一圈毛。第二天临时要一张竖版配图,昨天那张横图只能重新生成,人物脸又变了。
图已经有了,真正麻烦的活儿才刚开始。
Qwen 最近开源的 Qwen-Image-2.1,正好碰在这个麻烦上。它是一套文生图模型,模型卡里也写了图像质量、文字渲染和肖像光照这些常见卖点。我没太把注意力放在样张上,反倒盯着另外几项能力看了很久。透明图、图像编辑、局部修改、多张参考图,终于被放到同一个模型里。它们管的都是出图以后那些零碎却躲不开的活。

图源为 Qwen 官方发布页。官方展示中的文字渲染样例。
我把官方模型卡、GitHub 仓库和使用入口对了一遍。能确认的是,Qwen-Image-2.1 采用 Qwen Research License Agreement,视觉生成组件为 7B 参数,采用 32 层 Single-Stream DiT。它能按文字生成普通图或 RGBA 透明图,也能接收图片继续编辑。不同显卡上的速度、显存占用和实际成图稳定性,官方没有替任何人的工作流做担保,后面还得自己跑一轮。

图片来自 Qwen 官方发布页。

封面图展示透明图、参考图和局部编辑汇入同一套设计工作台。
一张成图,往往只是工作的开头
过去一段时间,AI 画图的讨论很容易绕到同一个问题上。哪家更真实,哪家更会画手。提示词能少写几句就出图,也常被当作一项优势。
做内容时,画面要是进了下一步,评价标准就得跟着换。
比如一篇文章要做视觉素材,通常不止交一张封面。正文里得有一张小图,社交平台还要一张竖图。人物主体如果能脱离背景留下来,后面的海报、动图和标题卡也许还能接着用。色调得差不多,人物设定得对上,画面看起来才像同一套东西。
以前很像抽盲盒。重新描述一次,模型就重新理解一次。提示词写得再长,角色的发型、衣服、产品外形和场景关系也常常接不上。人只好把图生图、ControlNet、抠图工具和 Photoshop 都拉进来补洞。工具本身没问题,麻烦出在文件来回走,最后总有人忘了哪张才是最新版本。
设计师做品牌物料时早就有一套处理办法。主视觉先定下来,再拆出人物、图标、背景、颜色、字体和版式,按不同页面重新组装。以后还找得到、改得动、拼得回去,这些元素才配叫资产。
AI 图像模型补的就是这部分工作。
透明背景终于有了正经位置
Qwen-Image-2.1 官方模型卡把原生透明图列为一项核心能力。用户可以用文字直接生成带 Alpha 通道的 RGBA 图,也可以编辑透明图层,或者从照片中提取主体。
这听上去像个小参数。做过排版的人知道,图片一旦离不开第一次生成时的背景,后面想挪一点位置都麻烦。
假设你要为一篇关于 AI 编程的文章做封面。先得到一张“开发者在深色工作台前使用 AI 工具”的整图,当然可以直接发。可等到编辑希望把标题改到左边,右侧保留人物,或者下一篇文章还想用这个人物做系列海报时,原图就开始碍事。人物和背景粘在一起,任何挪动都会带出旧光影、旧桌面和旧颜色。
透明图让工作从“找一张图”变成“先拿到一个可摆放的主体”。人物、产品、贴纸、图标、装饰物可以先作为独立对象留着。后面换深色背景、浅色背景、横版封面、竖版卡片,工作会轻很多。

图片来自 Qwen 官方发布页,展示原生透明图输出。

透明主体留下来,后续的封面、竖图和贴纸才不必每次重新抽一张。
这也适合没有专业设计团队的小团队。写文章的人、剪视频的人和负责社交媒体的人,常常各用一套工具。透明素材放在共享目录里,比把一张压扁的成图反复发来发去可靠得多。至少下一次要改时,没人需要从头猜提示词。
当然,原生透明图并不保证每次边缘都干净。发丝、玻璃、半透明布料、复杂反光本来就难处理。它的意义在于模型把透明输出当成正式目标来训练和支持,用户不必每次都先生成白底或复杂背景,再赌一次抠图结果。
多张参考图解决的是连续性
官方说明里还有一个值得多看两眼的参数。Qwen-Image-2.1 支持最多十张参考图,局部修改可以用圈选、涂抹标注或单独的掩码来说明位置。模型卡还提到,它尝试维持人物和产品的身份一致性。
生成图像时,参考图不是简单的“拿这张当灵感”。对内容工作流来说,它更像给模型一份现有资产清单。
有了几张已经确认过的图,你可以告诉模型,人物用这张脸和这件衣服,产品维持这个轮廓,背景沿用那套色彩,再根据新的版式补一张竖图。它未必每次都完全准确,尤其是面对真实品牌标识、复杂商品结构或多人物关系时,仍需要人工检查。可这比只依靠一段文字描述稳定得多。

图片来自 Qwen 官方发布页,官方用六张人物参考图展示群像生成能力。
我更关心的是另一类场景。
一套内容做久了,会慢慢长出自己的习惯。封面留多少空白,插图线条多粗,人物离标题多远,颜色怎么控制。过去这些习惯多半在设计师脑子里,也散在 PSD、Figma 文件和历史图片里。挑出几张确认过的图以后,它们就能慢慢变成给模型用的参考资产。
参考图多了,冲突也会跟着来。十张图里混着三种光线、两套角色设计,模型不会替你当艺术总监,只会尽量满足输入。先把素材整理干净,反而更有用。
留两三张人物参考图,再补一两张背景和色调图,一张版式参考图,通常就够开始试。每次只改一个变量。人物不动,换背景。背景不动,改标题空白区。出了问题,才知道该从哪里修。
局部编辑让返工不必推倒重来
内容生产里最耗人的事,常常排在第一次生成之后。编辑通常会丢来一串小改动。“这只手换成拿手机,右上角空一点,方便放标题。产品别动,把桌面换成浅色。人物衣服保留,脸再自然一点。”第七次改这种小地方,才会把人拖住。
以前遇到这种请求,很多人会干脆重抽。因为模型不知道哪部分必须保持,哪部分可以动。一张图重来以后,原来满意的地方也一并丢了。
Qwen-Image-2.1 提供圈选、涂抹标注和掩码等局部编辑方式。它让人能把“改哪里”说清楚。文字提示和空间位置放在一起,模型收到的信息就完整得多。

局部修改要带着范围走。主视觉已经定下来的时候,这类控制才最省返工。
它和设计工具靠近了一步。选择框、蒙版、图层都在告诉软件哪一块可以动。你不用每次重新描述整个画布,只要说明这一小块怎么变。AI 模型过去更擅长听整体描述,现在开始能接住这种范围明确的修改。
局部编辑适合修局部,救不了一开始就跑偏的方向。人物、构图、叙事关系都没定好,拿掩码一路修下去,最后很容易得到一张局部还行、整体却不协调的图。主视觉先定下来,后面再用局部编辑修正,效率才会出来。
7B 参数带来的,是尝试门槛
Qwen-Image-2.1 的视觉生成组件是 7B 参数。普通电脑未必能轻松跑起来,模型卡示例依然默认 CUDA 环境和 bfloat16。官方也给了 CPU offload 的用法,显存管理还是本地部署绕不开的一关。
可 7B 的意义确实和动辄数十亿、上百亿参数的全能模型不一样。
7B 让更多人愿意把它放进本地工作流,而不是每次都把素材上传到一个黑箱网页,等它吐回一张图片。Hugging Face 页面列出 Diffusers、Google Colab、Kaggle、Draw Things 和 DiffusionBee 等入口。社区也已经开始讨论 ComfyUI、GGUF 和量化版本。
本地跑模型有几个实在的好处。敏感素材不必随手传给每一个在线服务,批量试图不会卡在网页界面上,文件夹、脚本和版式工具也更容易接起来。
代价也摆在那儿。装环境、下载权重、处理显存、等推理、更新依赖,都要时间。赶稿时用在线入口,做系列项目时把稳定的部分放回本地,这种来回切换对多数内容创作者更现实。模型开放出来,选择才有意义。
许可证也得先看清。Qwen-Image-2.1 使用 Qwen Research License Agreement,看到“开源”两个字,不能直接推成所有商业项目都能无条件使用。接入客户项目、做付费产品或拿它训练衍生服务之前,先读许可条款,比生成完一堆素材再回头处理合规问题省事。
先把图片当文件管理,模型才会真的帮上忙
如果你今天就想试 Qwen-Image-2.1,先别从“给我生成一张很好看的图”开始。
挑一个会反复出现的场景就行。每周文章封面,或者小红书里的知识卡片。建一个小文件夹,放进已经确认过的人物或产品参考图,再配一两张背景和色调图。
一张你喜欢的版式样张,用来约束留白、标题区和主体位置。文案、视频和社交媒体由不同人负责时,这个样张也能帮大家看齐方向。
接下来每次生成都留下版本。原始输出、透明主体、最终排版图分开存。图片命名别只写“最终版”“最终版2”“真的最终版”,后面找起来会很痛苦。按日期、主题、用途和版本写清楚,AI 才能从一次性灵感工具,变成流程里的一个环节。
这套习惯听上去有点笨,甚至比换一个模型慢。但它会把返工从随机碰运气,变成有位置、有参考、有历史版本的修改。模型换了也不至于从零开始,因为你留住的是一组自己的视觉资产,不只是某家平台的一段提示词。
Qwen-Image-2.1 这次提供的透明输出、参考图和局部编辑,都在往这个方向推。模型负责生成和改图,人仍然要决定什么能留下来、什么该删掉、什么才算这一套内容的样子。
图像生成工具越来越多,最后能积累下来的,还是那些能反复使用的文件和判断。
参考来源
以上来源主要用于核对产品发布口径、功能说明和使用入口。实际推理速度、显存占用、商用适用范围与成图质量仍取决于本地硬件、版本和具体工作流。