上个月,微软正式发布了其最新一代自研图像生成模型 MAI-Image-2.6。在发布之初,该模型便在 Arena 的文生图排行榜上强势斩获第二名的佳绩,仅次于 OpenAI 的 GPT-Image-2,且相较于上一代 MAI-Image-2.5,其 Elo 评分大幅跃升了 79 分,展现出微软在 AI 图像生成领域的强劲实力。
如今,微软不仅通过 Microsoft Foundry 平台将 MAI-Image-2.6 正式开放给开发者,还同步推出了一款全新变体 —— MAI-Image-2.6-Flash。该版本专为那些对生成速度和成本更为敏感的应用场景而打造。
据微软介绍,MAI-Image-2.6-Flash 的图像生成速度达到了 GPT-Image-2-Medium 的 2.8 倍,同时 GPU 效率提升了 72%。微软强调,这款模型非常适合交互式应用、快速创意迭代、个性化定制、自动化流水线,以及其他需要大规模批量生成图像的工作负载。
尽管 MAI-Image-2.6-Flash 将重点放在了提升速度和降低成本上,但它依然完整继承了旗舰版 MAI-Image-2.6 的核心生成与编辑能力。它不仅支持文本生成图像(文生图)和图像到图像的编辑(图生图),还能进行精准的局部编辑 —— 例如在不大幅改变图像其余部分的前提下,对单个对象、布局或文本进行替换与修改。
此外,MAI-Image-2.6 系列模型还为开发者带来了多项全新能力:
多图参考控制:开发者最多可使用 5 张参考图,以确保生成的人物、产品、角色及其他资产在视觉上保持高度一致性。
网络信息增强(Web Grounding):在生成涉及现实世界主题的图像时,模型可通过 Bing 搜索检索实时信息,从而补充现实世界的图像细节。
更灵活的输出:新增了动态宽高比支持,并能够输出更高分辨率的图像。
在定价方面,MAI-Image-2.6-Flash 展现出了极高的性价比。其文本输入价格为每百万 Token 1.75 美元,图像输入为 2.50 美元,图像输出为 19 美元。相比之下,旗舰版 MAI-Image-2.6 的对应价格分别为 5 美元、8 美元和 38 美元。
针对不同的使用需求,微软给出了明确的建议:对于最终的生产素材、复杂的图像编辑、商业设计,以及对极限画质和文本渲染要求极高的任务,推荐使用 MAI-Image-2.6;而当应用场景对延迟、吞吐量以及成本控制有较高要求时,MAI-Image-2.6-Flash 则是最佳选择。
目前,MAI-Image-2.6 与 MAI-Image-2.6-Flash 均已通过 Microsoft Foundry 平台开启公开预览,开发者和企业用户可以随时接入体验。