SenseNova U1.5-8B-MoT是商汤科技开源的原生统一多模态大模型正式版,基于NEO-unify架构,无视觉编码器与VAE,原生MoT设计,于2026年8月20日发布并采用Apache 2.0许可证,在指令遵循、文字排版、原生4K生成、图像编辑与视觉控制六个方面较Preview版全面升级。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 原生统一多模态大模型(正式版) |
| 开发公司 | 商汤科技SenseTime |
| 发布时间 | 2026年8月20日(Preview版为7月31日) |
| 参数规模 | 8B MoT(约8B理解参数+8B生成参数) |
| 架构 | NEO-unify原生统一架构,无VE与VAE |
| 核心能力 | 文生图、图像编辑、交错图文生成、原生4K输出 |
| 许可证 | Apache 2.0 |
| 适用人群 | 设计师、内容创作者、多模态应用开发者 |

SenseNova U1.5-8B-MoT核心能力
较Preview版的六大官方升级
根据商汤官方GitHub仓库说明,正式版相较此前开放的预览版在六个方面完成升级:
- 指令遵循更强:复杂指令的执行一致性显著提升
- 文本渲染与排版更佳:中英文文字生成与多文本布局更稳定
- 更高效的原生4K生成:高分辨率下兼顾构图与细节
- 更可靠的原生图像编辑:主体身份与未编辑区域保留更强
- 复杂指令执行更一致:物体数量、空间关系、布局、风格可控
- 视觉控制更精准:边界框、视觉标记、多图参考
NEO-unify原生统一架构
SenseNova U1.5-8B-MoT基于NEO-unify原生统一多模态架构,不依赖视觉编码器(VE)和变分自编码器(VAE),使用原生MoT(Mixture-of-Transformers)设计,约8B理解参数加8B生成参数。文本与视觉信息在同一框架内深度融合,可直接理解复杂图文指令并完成生成与编辑,无需额外的模态转换或拼接模块。这与商汤此前推出的SenseNova-Vision统一视觉理解生成路线一脉相承。
原生4K输出与精细视觉控制
模型支持原生4K高分辨率图像生成,在超高分辨率下兼顾整体构图与极精细的肌理、微小文字和光影折射。同时提供Bounding Box、Visual Marker及单图/多图参考等精细控制方式,可对指定区域和对象做精准编辑,官方基准覆盖OneIG中英文、LongText、BizGenEval、CVTG、IGenBench与Qwen-Image-Bench等多维评测。
配套生态:LoRA加速与量化路线
除主模型外,官方同步开源SenseNova-U1.5-8B-MoT-LoRA-8step(0.4B,8步快速推理LoRA)与SFT版本,社区贡献者已提供Preview版的Q8 GGUF量化检查点(19.9GB),官方U1.5-Lite的GGUF量化权重也已在路线图中预告,本地部署门槛将持续降低。
SenseNova U1.5-8B-MoT与同类多模态模型对比
| 对比维度 | SenseNova U1.5-8B-MoT | U1.5 Preview版 | Janus-Pro-7B |
|---|---|---|---|
| 参数规模 | 8B MoT(理解+生成约16B) | 8B MoT | 7B |
| 指令长度 | 超长复杂指令遵循 | 长指令支持 | 常规长度指令 |
| 图像编辑 | 原生编辑,区域保持 | 基础编辑 | 较弱 |
| 文字渲染 | 中英文与复杂排版强化 | 一般 | 一般 |
| 分辨率 | 原生4K输出 | 支持4K | 常规分辨率 |
| 视觉控制 | BBox/Marker/多图参考 | 基础控制 | 有限 |
| 许可证 | Apache 2.0 | Apache 2.0 | MIT |
注:U1.5-8B-MoT与Preview版对比数据来自商汤官方GitHub仓库README;Janus-Pro-7B为业界常用的统一多模态理解生成模型,此处仅作能力维度参照。
从官方说明可以看出,正式版的核心价值不在参数规模变化,而在真实创作交付的稳定性:文字排版、图像编辑的区域保持、4K细节与精细控制这四项正是海报、信息图等商业视觉任务最依赖的能力。此前体验过预览版的用户可参考站内的SenseNova U1.5-Lite-Preview评测,正式版在这些维度上的升级幅度属于代际提升,配合模型栏目的多模态选型参考,可按需选择商汤系列的不同版本。
SenseNova U1.5-8B-MoT应用场景与适用人群
SenseNova U1.5-8B-MoT特别适合真实视觉交付流程中的生成与编辑任务。
- 创意海报与封面设计:按长指令生成海报、杂志封面,精准控制文字排版与风格调性
- 信息图与图文混排:将数据与知识转化为高密度信息图,保证文字准确与视觉逻辑
- 品牌视觉物料:批量生成统一风格的包装、社媒配图与广告Banner
- 电商产品图编辑:保留主体与背景的局部替换、文字精修与光影调整
- 交错图文内容创作:生成图文交织的教程、攻略类长内容,支持多种宽高比
适用人群:主要是设计师、内容创作者、电商运营与品牌营销人员,以及需要私有化部署多模态生成能力的开发者。
如何使用SenseNova U1.5-8B-MoT
官方提供GitHub源码部署与HuggingFace、ModelScope权重下载两条路径,另有SenseNova Studio网页端可直接在线体验。
环境准备
- Python环境:按官方仓库requirements安装依赖
- GPU资源:18B级参数模型,建议大显存显卡或多卡环境,低配可关注GGUF量化版
- 模型权重:从HuggingFace sensenova组织页或ModelScope下载SenseNova-U1.5-8B-MoT
- 源码仓库:克隆OpenSenseNova/SenseNova-U1获取推理脚本
快速开始(本地推理)
- 克隆仓库:git clone获取examples目录下的推理脚本
- 下载权重:获取SenseNova-U1.5-8B-MoT主模型,可选LoRA-8step加速推理
- 文生图:运行examples/t2i/inference.py并传入model_path与prompt生成图像
- 图像编辑:运行examples/editing/inference.py,传入原图与编辑指令完成局部修改
- 交错图文:运行examples/interleave/inference.py,可指定16:9等分辨率比例输出
源码与完整文档见官方仓库:github.com/OpenSenseNova/SenseNova-U1
SenseNova U1.5-8B-MoT开源情况
- 许可证:Apache 2.0,支持商用
- 开放范围:主模型、SFT版本与LoRA-8step加速权重均在HuggingFace与ModelScope开放
- 在线体验:SenseNova Studio网页端可直接试用,无需本地部署
- 量化路线:官方预告U1.5-Lite GGUF即将推出,社区已有Preview版Q8量化
- 价格:权重免费开源,成本主要为推理算力或云服务费用
SenseNova U1.5-8B-MoT和预览版有什么区别?
正式版于2026年8月20日发布,官方说明其在指令遵循、文本渲染、原生4K生成、图像编辑、复杂指令一致性与视觉控制六个方面较Preview版(7月31日发布)全面升级,参数架构保持8B MoT。
这个模型能直接做图像编辑吗?
可以。原生图像编辑是其核心能力之一,支持局部修改、元素替换,并在编辑时保持主体身份与非编辑区域不变,官方仓库提供editing推理脚本示例。
本地部署需要什么显卡?
模型为8B MoT设计但总参数量约18B,建议大显存显卡;显存有限可关注官方预告的U1.5-Lite GGUF量化版或社区提供的Preview版Q8量化检查点。
许可证允许商用吗?
允许。主模型与配套权重均采用Apache 2.0许可证,商用无额外授权要求。
和Janus-Pro-7B相比怎么选?
Janus-Pro-7B侧重理解与生成的平衡,参数更小;U1.5-8B-MoT的文字渲染、4K输出与精细视觉控制更强,更适合海报、信息图等文字密集型商业视觉任务。
浙公网安备33010202004812号