通义开源Qwen-Image-2.1:文生图编辑合一,原生透明图层

AI资讯14分钟前发布 pruitt
2.3K 0

做电商图的人,最烦的一步往往是抠图。

9月20日开源的Qwen-Image-2.1,把这件事直接收进了模型里:原生支持透明图像的生成与编辑。出来的图自带透明背景,拿去叠图层、做海报素材,不必再过一遍抠图工具。

结构上的变化同样不小。这一版把文生图和图像编辑统一到了一个模型里,视觉生成组件是7B参数。以前常见的做法是一个模型负责出图、另一个负责改图,中间来回导文件;合在一起之后,先生成、再局部修改可以在同一条流程里走完。

7B这个规模,对想自己部署的团队算是友好的档位,具体吃多少显存,还得等实测数据。

能力清单上,它支持最多10张参考图输入、局部编辑、人物与商品的特征保持,还能生成全景图、信息图和分镜。

特征保持这一项最贴近商用。同一个模特换十套衣服,同一款商品换十个场景,脸和包装都不走样,这是AI出图能不能真正交付的分界线。多参考图输入配合它,等于给模型多看几个角度,出错的空间会小一些。

分镜生成则往视频前期延伸了一步,做短片的人可以先用它把镜头顺序和画面构图过一遍。

官方还提到改进了文字渲染、肖像光照和细节表现。文字一直是开源图像模型的软肋,信息图能不能做成,很大程度取决于字写得对不对。这一项到底提升了多少,社区跑一轮测试就清楚了。

© 版权声明

相关文章

通义开源Qwen-Image-2.1:文生图编辑合一,原生透明图层 暂无评论

none
暂无评论...