AI 资讯速递 (2026/9/21): 阿里通义团队开源图像模型 Qwen-Image-2.1

2026年9月21日 07:45

导读摘要:

阿里通义实验室于9月21日发布Qwen-Image-2.1图像生成模型开源版本,在保持7B参数规模前提下实现文生图与图像编辑功能融合,并新增透明通道处理能力。

资讯详情

阿里通义团队通过本次开源更新,在视觉生成领域完成关键性技术突破。该模型在保持7B参数量级的同时集成文本驱动图像生成与后期编辑模块,并原生支持Alpha通道处理及多模态输入接口。


核心要点

【轻量化架构】
视觉生成模块仅需7B参数量即可达到主流图像质量标准,在消费级GPU上实现单次推理成本低于$0.05(按NVIDIA A100等效算力折算)。

【全链路工作流】
将文本到图像生成与基于掩码的局部编辑能力封装为统一API接口,开发者可通过edit_mask参数直接调用涂抹/圈选编辑模式而无需切换不同模型实例。

【透明通道处理】
新增transparent_channel输出选项与layer_composite图层合成算法,在商品设计场景中可直接导出PNG格式素材,并支持多图层非破坏性编辑操作。


AI-ALL 深度点评

该模型通过参数共享机制实现生成与编辑能力的统一架构设计,在视觉AI领域开创"Single Model for Full Pipeline"新范式。其7B参数规模显著降低企业部署门槛——相比Stable Diffusion XL 1.4版(860M~4GB显存)提升3个数量级推理效率的同时维持商业级输出精度。

透明通道原生支持特性解决了现有文生图工具在电商/游戏等专业领域的适配难题,配合最多10张参考图输入能力可构建更复杂的视觉合成场景。值得注意的是其采用动态分辨率调整策略,在保持输出质量时自动匹配输入参考图尺寸以优化显存占用。

此次开源选择HuggingFace格式并提供ONNX量化版本(INT8精度),开发者可通过transformers库直接加载模型权重文件进行微调训练。这种开放策略或将加速视觉生成技术在AIGC工具链中的渗透率提升。

关于AI资讯

我们使用AI技术每日自动获取和筛选全球最新的人工智能资讯,为您提供最有价值的行业动态。