FLUX 3 Image – Black Forest Labs 推出的高可控图像生成与编辑模型

AI模型1天前更新 老高
12 0

FLUX 3 Image是一款由Black Forest Labs于2026年10月推出的高可控图像生成与编辑模型,主要用于按元素排布生成画面并对成品做像素级局部修改,支持原生 2K 与 4K 输出以及多张参考图合成,适用于电商视觉、广告创意与设计出图等方向。

基础信息内容
产品定位高可控图像生成与编辑模型
出品方Black Forest Labs(德国)
发布时间2026年10月2日
基座模型FLUX 3 多模态基础模型
输出分辨率原生 2K 与 4K
最高输出规格5456 × 3072 像素
参考图上限单次最多 10 张
元素排布0 至 1000 坐标网格
局部编辑像素级多轮编辑
开放情况开放权重版本数周内公布
接入方式官方接口按张计费
FLUX 3 Image – Black Forest Labs 推出的高可控图像生成与编辑模型

FLUX 3 Image 的核心能力

Black Forest Labs 把 FLUX 3 Image 定位为图像生成流程中的可控层。此前的文生图模型以提示词描述整体画面,元素的位置关系由模型自行判断;FLUX 3 Image 改为先划出每个元素的位置、再生成画面内容。这一顺序变化直接影响了 AIGC 工作流里人工修图所占的比重:排版在生成阶段就已确定,后续调整集中在局部,而不是整图重绘。

用包围盒把每个元素放到指定位置

模型的画布在横纵两个方向上都被归一化为 0 至 1000 的坐标网格。用户为每个需要控制的元素拖出一个包围盒,填写元素的 ID 与文字描述,再给出一句串联全局的场景提示词,模型会在各自盒内渲染对应内容。官方示例中,同一张画面里的文字、建筑、人物与人群分别占位,文字元素还能保留指定的字体与排版风格。

单次最多融合 10 张参考图像

模型单次生成最多可接受 10 张参考图像,并可为每张参考图中的对象指定出现位置。参考图与包围盒可以叠加使用:位置由坐标决定,外观由参考图决定,适合把商品图、模特图与背景素材合成为一张成片。

像素级多轮局部编辑

编辑能力是这条产品线的另一主线。模型可只修改指定区域,官方称其余像素保持不变,因此可以在同一张成片上连续执行多轮修改,不必每次从原图重新生成。官方演示中的增删对象、替换家具、改发色与消除痕迹等操作,均以单次局部改动完成。

原生 2K 与 4K 输出

模型支持原生 2K 与 4K 生成,官方示例的输出规格为 5456 × 3072 像素,约 16.8 MP。高分辨率在生成阶段直接完成,画面中的纹理、面部与色彩在小尺寸下即能保留,无需再走一遍放大流程。

面向智能体的版面理解与调用

FLUX 3 Image 在训练中即面向版面与构图理解。官方给出的典型用法是:由大语言模型读取一句提示词与画幅比例,写出一份包含元素 ID、描述与坐标的元素表,再交由模型按表生成。元素表在生成前后都可以编辑,调整某一个盒子不会改变其他元素的位置,这一流程使图像生成可以直接嵌入自动化管线,而不是停留在单张试画。

FLUX 3 Image 与同类图像生成模型的对比

对比维度FLUX 3 ImageQwen-Image-2.1MAI-Image-2.6-Flash
出品方Black Forest Labs(德国)阿里通义千问微软人工智能
产品定位高可控图像生成与编辑模型一体化图像生成与编辑模型图像生成与编辑模型(高速版)
最高分辨率4K,5456 × 3072 像素官方未公布1.5K
参考图上限10 张10 张官方未公布
编辑方式包围盒元素级排布,像素级多轮编辑圈选、涂抹与独立掩码图生图与多图参考编辑
开放与授权开放权重将公布,另提供商业权重许可开源,研究许可、禁止商业使用闭源,仅云端调用
计费方式每张 0.024 至 0.048 美元开放权重自行部署每百万输出 token 约 19 美元

上表 FLUX 3 Image 一列取自 Black Forest Labs 官方模型页与定价页,Qwen-Image-2.1 一列取自阿里通义千问官方模型说明,MAI-Image-2.6-Flash 一列取自微软官方发布材料。三者的差异集中在三处:分辨率上,FLUX 3 Image 与 MAI-Image-2.6-Flash 分别给出 4K 与 1.5K,Qwen-Image-2.1 未标注输出上限;控制方式上,FLUX 3 Image 把位置交给坐标盒,Qwen-Image-2.1 以圈选与掩码在成品上改,MAI-Image-2.6-Flash 以参考图与图生图为主;开放程度上,Qwen-Image-2.1 已放出权重但限定研究用途,FLUX 3 Image 的开放版本尚在数周之后,MAI-Image-2.6-Flash 则维持闭源。

如果偏好已经开放权重、可直接部署的方案,可以参考 Seedream 5.0(字节跳动推出的高分辨率图像生成与编辑模型,侧重出图清晰度与中文字形表现)。

FLUX 3 Image 的应用场景与适用人群

该模型面向对画面结构有明确要求的出图任务,常见场景包括:

  • 电商与商品视觉:把商品图、模特图与背景素材按固定版式合成主图与详情页图,位置与留白在生成前即可锁定。
  • 广告与海报排版:标题文字、主体与背景分区生成,文字元素的位置与字体样式可控。
  • 设计出图与提案:先排版、后生成,多轮修改集中在局部,减少整图重绘带来的风格漂移。
  • 自动化图像管线:由语言模型规划版式并产出元素表,模型按表生成,适合批量出图的流程。

适用人群:需要精确控制构图与元素位置的电商与广告设计团队、以图像生成模型搭建自动化管线的开发者,以及对局部反复修改要求较高的设计人员。只做单张创意草图的用户,直接写提示词生成的方式已经够用。

FLUX 3 Image 的使用方法

模型通过 Black Forest Labs 官方接口提供,按以下顺序接入:

  1. 核对能力边界:在 FLUX 3 Image 官方模型页 中确认输出规格、参考图数量与编辑方式。
  2. 选择生成方式:只给提示词做文生图,或先为每个元素划出包围盒、填写描述后再生成。
  3. 准备元素表:每个元素给出一条 ID、一句描述与一个边界框 [y_min, x_min, y_max, x_max],坐标取 0 至 1000 的归一化值。
  4. 选择输出档位:按用途在原生 2K 与 4K 之间选择,高分辨率在生成阶段直接输出。
  5. 局部调整:对不满意的区域单独发起编辑,未改动的像素保持不变,可在同一张图上连续执行多轮。

接入初期建议先用少量元素验证坐标与描述的理解程度,再扩展到完整版面。

FLUX 3 Image 的价格与开源情况

FLUX 3 Image 目前作为 Black Forest Labs 的付费服务提供,官方接口采用按量计费,不设订阅与席位费用。官方定价页给出的示例单价为每张 0.024 美元至 0.048 美元,按输出分辨率档位浮动;企业级需求可另行洽谈批量折扣与服务保障。

模型权重方面,公司表示开放模型版本将于数周内公开;面向规模化运行的机构,另可选择商业权重许可,在自有基础设施上微调与部署。当前阶段可用的仍是云端接口,本地部署需要等待权重放出。

FLUX 3 Image 的常见问题

FLUX 3 Image 与 FLUX 3 是什么关系?

FLUX 3 是 Black Forest Labs 面向视频、音频、图像与动作的多模态基础模型,FLUX 3 Image 是其中负责图像生成与编辑的部分。它先按包围盒确定每个元素的位置,再生成画面内容。

FLUX 3 Image 支持哪些输出分辨率?

模型支持原生 2K 与 4K 生成,官方示例的输出规格为 5456 × 3072 像素,约 16.8 MP。高分辨率在生成阶段直接完成,画面细节无需再经过额外的放大流程。

FLUX 3 Image 的权重会开放吗?

公司表示开放模型版本将于数周内公开,在此之前仅提供云端付费接口。面向规模化运行的机构可选择商业权重许可,在自有基础设施上微调与部署。

© 版权声明

相关文章