FLUX 3 Image是一款由Black Forest Labs于2026年10月推出的高可控图像生成与编辑模型,主要用于按元素排布生成画面并对成品做像素级局部修改,支持原生 2K 与 4K 输出以及多张参考图合成,适用于电商视觉、广告创意与设计出图等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 高可控图像生成与编辑模型 |
| 出品方 | Black Forest Labs(德国) |
| 发布时间 | 2026年10月2日 |
| 基座模型 | FLUX 3 多模态基础模型 |
| 输出分辨率 | 原生 2K 与 4K |
| 最高输出规格 | 5456 × 3072 像素 |
| 参考图上限 | 单次最多 10 张 |
| 元素排布 | 0 至 1000 坐标网格 |
| 局部编辑 | 像素级多轮编辑 |
| 开放情况 | 开放权重版本数周内公布 |
| 接入方式 | 官方接口按张计费 |

FLUX 3 Image 的核心能力
Black Forest Labs 把 FLUX 3 Image 定位为图像生成流程中的可控层。此前的文生图模型以提示词描述整体画面,元素的位置关系由模型自行判断;FLUX 3 Image 改为先划出每个元素的位置、再生成画面内容。这一顺序变化直接影响了 AIGC 工作流里人工修图所占的比重:排版在生成阶段就已确定,后续调整集中在局部,而不是整图重绘。
用包围盒把每个元素放到指定位置
模型的画布在横纵两个方向上都被归一化为 0 至 1000 的坐标网格。用户为每个需要控制的元素拖出一个包围盒,填写元素的 ID 与文字描述,再给出一句串联全局的场景提示词,模型会在各自盒内渲染对应内容。官方示例中,同一张画面里的文字、建筑、人物与人群分别占位,文字元素还能保留指定的字体与排版风格。
单次最多融合 10 张参考图像
模型单次生成最多可接受 10 张参考图像,并可为每张参考图中的对象指定出现位置。参考图与包围盒可以叠加使用:位置由坐标决定,外观由参考图决定,适合把商品图、模特图与背景素材合成为一张成片。
像素级多轮局部编辑
编辑能力是这条产品线的另一主线。模型可只修改指定区域,官方称其余像素保持不变,因此可以在同一张成片上连续执行多轮修改,不必每次从原图重新生成。官方演示中的增删对象、替换家具、改发色与消除痕迹等操作,均以单次局部改动完成。
原生 2K 与 4K 输出
模型支持原生 2K 与 4K 生成,官方示例的输出规格为 5456 × 3072 像素,约 16.8 MP。高分辨率在生成阶段直接完成,画面中的纹理、面部与色彩在小尺寸下即能保留,无需再走一遍放大流程。
面向智能体的版面理解与调用
FLUX 3 Image 在训练中即面向版面与构图理解。官方给出的典型用法是:由大语言模型读取一句提示词与画幅比例,写出一份包含元素 ID、描述与坐标的元素表,再交由模型按表生成。元素表在生成前后都可以编辑,调整某一个盒子不会改变其他元素的位置,这一流程使图像生成可以直接嵌入自动化管线,而不是停留在单张试画。
FLUX 3 Image 与同类图像生成模型的对比
| 对比维度 | FLUX 3 Image | Qwen-Image-2.1 | MAI-Image-2.6-Flash |
|---|---|---|---|
| 出品方 | Black Forest Labs(德国) | 阿里通义千问 | 微软人工智能 |
| 产品定位 | 高可控图像生成与编辑模型 | 一体化图像生成与编辑模型 | 图像生成与编辑模型(高速版) |
| 最高分辨率 | 4K,5456 × 3072 像素 | 官方未公布 | 1.5K |
| 参考图上限 | 10 张 | 10 张 | 官方未公布 |
| 编辑方式 | 包围盒元素级排布,像素级多轮编辑 | 圈选、涂抹与独立掩码 | 图生图与多图参考编辑 |
| 开放与授权 | 开放权重将公布,另提供商业权重许可 | 开源,研究许可、禁止商业使用 | 闭源,仅云端调用 |
| 计费方式 | 每张 0.024 至 0.048 美元 | 开放权重自行部署 | 每百万输出 token 约 19 美元 |
上表 FLUX 3 Image 一列取自 Black Forest Labs 官方模型页与定价页,Qwen-Image-2.1 一列取自阿里通义千问官方模型说明,MAI-Image-2.6-Flash 一列取自微软官方发布材料。三者的差异集中在三处:分辨率上,FLUX 3 Image 与 MAI-Image-2.6-Flash 分别给出 4K 与 1.5K,Qwen-Image-2.1 未标注输出上限;控制方式上,FLUX 3 Image 把位置交给坐标盒,Qwen-Image-2.1 以圈选与掩码在成品上改,MAI-Image-2.6-Flash 以参考图与图生图为主;开放程度上,Qwen-Image-2.1 已放出权重但限定研究用途,FLUX 3 Image 的开放版本尚在数周之后,MAI-Image-2.6-Flash 则维持闭源。
如果偏好已经开放权重、可直接部署的方案,可以参考 Seedream 5.0(字节跳动推出的高分辨率图像生成与编辑模型,侧重出图清晰度与中文字形表现)。
FLUX 3 Image 的应用场景与适用人群
该模型面向对画面结构有明确要求的出图任务,常见场景包括:
- 电商与商品视觉:把商品图、模特图与背景素材按固定版式合成主图与详情页图,位置与留白在生成前即可锁定。
- 广告与海报排版:标题文字、主体与背景分区生成,文字元素的位置与字体样式可控。
- 设计出图与提案:先排版、后生成,多轮修改集中在局部,减少整图重绘带来的风格漂移。
- 自动化图像管线:由语言模型规划版式并产出元素表,模型按表生成,适合批量出图的流程。
适用人群:需要精确控制构图与元素位置的电商与广告设计团队、以图像生成模型搭建自动化管线的开发者,以及对局部反复修改要求较高的设计人员。只做单张创意草图的用户,直接写提示词生成的方式已经够用。
FLUX 3 Image 的使用方法
模型通过 Black Forest Labs 官方接口提供,按以下顺序接入:
- 核对能力边界:在 FLUX 3 Image 官方模型页 中确认输出规格、参考图数量与编辑方式。
- 选择生成方式:只给提示词做文生图,或先为每个元素划出包围盒、填写描述后再生成。
- 准备元素表:每个元素给出一条 ID、一句描述与一个边界框
[y_min, x_min, y_max, x_max],坐标取 0 至 1000 的归一化值。 - 选择输出档位:按用途在原生 2K 与 4K 之间选择,高分辨率在生成阶段直接输出。
- 局部调整:对不满意的区域单独发起编辑,未改动的像素保持不变,可在同一张图上连续执行多轮。
接入初期建议先用少量元素验证坐标与描述的理解程度,再扩展到完整版面。
FLUX 3 Image 的价格与开源情况
FLUX 3 Image 目前作为 Black Forest Labs 的付费服务提供,官方接口采用按量计费,不设订阅与席位费用。官方定价页给出的示例单价为每张 0.024 美元至 0.048 美元,按输出分辨率档位浮动;企业级需求可另行洽谈批量折扣与服务保障。
模型权重方面,公司表示开放模型版本将于数周内公开;面向规模化运行的机构,另可选择商业权重许可,在自有基础设施上微调与部署。当前阶段可用的仍是云端接口,本地部署需要等待权重放出。
FLUX 3 Image 的常见问题
FLUX 3 Image 与 FLUX 3 是什么关系?
FLUX 3 是 Black Forest Labs 面向视频、音频、图像与动作的多模态基础模型,FLUX 3 Image 是其中负责图像生成与编辑的部分。它先按包围盒确定每个元素的位置,再生成画面内容。
FLUX 3 Image 支持哪些输出分辨率?
模型支持原生 2K 与 4K 生成,官方示例的输出规格为 5456 × 3072 像素,约 16.8 MP。高分辨率在生成阶段直接完成,画面细节无需再经过额外的放大流程。
FLUX 3 Image 的权重会开放吗?
公司表示开放模型版本将于数周内公开,在此之前仅提供云端付费接口。面向规模化运行的机构可选择商业权重许可,在自有基础设施上微调与部署。
浙公网安备33010202004812号