SenseNova U1.5-8B-MoT – 商汤科技开源的原生统一多模态大模型

AI模型12小时前更新 智小研
12 0

SenseNova U1.5-8B-MoT商汤科技开源的原生统一多模态大模型正式版,基于NEO-unify架构,无视觉编码器与VAE,原生MoT设计,于2026年8月20日发布并采用Apache 2.0许可证,在指令遵循、文字排版、原生4K生成、图像编辑与视觉控制六个方面较Preview版全面升级。

基础信息内容
产品定位原生统一多模态大模型(正式版)
开发公司商汤科技SenseTime
发布时间2026年8月20日(Preview版为7月31日)
参数规模8B MoT(约8B理解参数+8B生成参数)
架构NEO-unify原生统一架构,无VE与VAE
核心能力文生图、图像编辑、交错图文生成、原生4K输出
许可证Apache 2.0
适用人群设计师、内容创作者、多模态应用开发者
SenseNova U1.5-8B-MoT – 商汤科技开源的原生统一多模态大模型

SenseNova U1.5-8B-MoT核心能力

较Preview版的六大官方升级

根据商汤官方GitHub仓库说明,正式版相较此前开放的预览版在六个方面完成升级:

  • 指令遵循更强:复杂指令的执行一致性显著提升
  • 文本渲染与排版更佳:中英文文字生成与多文本布局更稳定
  • 更高效的原生4K生成:高分辨率下兼顾构图与细节
  • 更可靠的原生图像编辑:主体身份与未编辑区域保留更强
  • 复杂指令执行更一致:物体数量、空间关系、布局、风格可控
  • 视觉控制更精准:边界框、视觉标记、多图参考

NEO-unify原生统一架构

SenseNova U1.5-8B-MoT基于NEO-unify原生统一多模态架构,不依赖视觉编码器(VE)和变分自编码器(VAE),使用原生MoT(Mixture-of-Transformers)设计,约8B理解参数加8B生成参数。文本与视觉信息在同一框架内深度融合,可直接理解复杂图文指令并完成生成与编辑,无需额外的模态转换或拼接模块。这与商汤此前推出的SenseNova-Vision统一视觉理解生成路线一脉相承。

原生4K输出与精细视觉控制

模型支持原生4K高分辨率图像生成,在超高分辨率下兼顾整体构图与极精细的肌理、微小文字和光影折射。同时提供Bounding Box、Visual Marker及单图/多图参考等精细控制方式,可对指定区域和对象做精准编辑,官方基准覆盖OneIG中英文、LongText、BizGenEval、CVTG、IGenBench与Qwen-Image-Bench等多维评测。

配套生态:LoRA加速与量化路线

除主模型外,官方同步开源SenseNova-U1.5-8B-MoT-LoRA-8step(0.4B,8步快速推理LoRA)与SFT版本,社区贡献者已提供Preview版的Q8 GGUF量化检查点(19.9GB),官方U1.5-Lite的GGUF量化权重也已在路线图中预告,本地部署门槛将持续降低。

SenseNova U1.5-8B-MoT与同类多模态模型对比

对比维度SenseNova U1.5-8B-MoTU1.5 Preview版Janus-Pro-7B
参数规模8B MoT(理解+生成约16B)8B MoT7B
指令长度超长复杂指令遵循长指令支持常规长度指令
图像编辑原生编辑,区域保持基础编辑较弱
文字渲染中英文与复杂排版强化一般一般
分辨率原生4K输出支持4K常规分辨率
视觉控制BBox/Marker/多图参考基础控制有限
许可证Apache 2.0Apache 2.0MIT

注:U1.5-8B-MoT与Preview版对比数据来自商汤官方GitHub仓库README;Janus-Pro-7B为业界常用的统一多模态理解生成模型,此处仅作能力维度参照。

从官方说明可以看出,正式版的核心价值不在参数规模变化,而在真实创作交付的稳定性:文字排版、图像编辑的区域保持、4K细节与精细控制这四项正是海报、信息图等商业视觉任务最依赖的能力。此前体验过预览版的用户可参考站内的SenseNova U1.5-Lite-Preview评测,正式版在这些维度上的升级幅度属于代际提升,配合模型栏目的多模态选型参考,可按需选择商汤系列的不同版本。

SenseNova U1.5-8B-MoT应用场景与适用人群

SenseNova U1.5-8B-MoT特别适合真实视觉交付流程中的生成与编辑任务。

  • 创意海报与封面设计:按长指令生成海报、杂志封面,精准控制文字排版与风格调性
  • 信息图与图文混排:将数据与知识转化为高密度信息图,保证文字准确与视觉逻辑
  • 品牌视觉物料:批量生成统一风格的包装、社媒配图与广告Banner
  • 电商产品图编辑:保留主体与背景的局部替换、文字精修与光影调整
  • 交错图文内容创作:生成图文交织的教程、攻略类长内容,支持多种宽高比

适用人群:主要是设计师、内容创作者、电商运营与品牌营销人员,以及需要私有化部署多模态生成能力的开发者。

如何使用SenseNova U1.5-8B-MoT

官方提供GitHub源码部署与HuggingFace、ModelScope权重下载两条路径,另有SenseNova Studio网页端可直接在线体验。

环境准备

  • Python环境:按官方仓库requirements安装依赖
  • GPU资源:18B级参数模型,建议大显存显卡或多卡环境,低配可关注GGUF量化版
  • 模型权重:从HuggingFace sensenova组织页或ModelScope下载SenseNova-U1.5-8B-MoT
  • 源码仓库:克隆OpenSenseNova/SenseNova-U1获取推理脚本

快速开始(本地推理)

  • 克隆仓库:git clone获取examples目录下的推理脚本
  • 下载权重:获取SenseNova-U1.5-8B-MoT主模型,可选LoRA-8step加速推理
  • 文生图:运行examples/t2i/inference.py并传入model_path与prompt生成图像
  • 图像编辑:运行examples/editing/inference.py,传入原图与编辑指令完成局部修改
  • 交错图文:运行examples/interleave/inference.py,可指定16:9等分辨率比例输出

源码与完整文档见官方仓库:github.com/OpenSenseNova/SenseNova-U1

SenseNova U1.5-8B-MoT开源情况

  • 许可证:Apache 2.0,支持商用
  • 开放范围:主模型、SFT版本与LoRA-8step加速权重均在HuggingFace与ModelScope开放
  • 在线体验:SenseNova Studio网页端可直接试用,无需本地部署
  • 量化路线:官方预告U1.5-Lite GGUF即将推出,社区已有Preview版Q8量化
  • 价格:权重免费开源,成本主要为推理算力或云服务费用

SenseNova U1.5-8B-MoT和预览版有什么区别?

正式版于2026年8月20日发布,官方说明其在指令遵循、文本渲染、原生4K生成、图像编辑、复杂指令一致性与视觉控制六个方面较Preview版(7月31日发布)全面升级,参数架构保持8B MoT。

这个模型能直接做图像编辑吗?

可以。原生图像编辑是其核心能力之一,支持局部修改、元素替换,并在编辑时保持主体身份与非编辑区域不变,官方仓库提供editing推理脚本示例。

本地部署需要什么显卡?

模型为8B MoT设计但总参数量约18B,建议大显存显卡;显存有限可关注官方预告的U1.5-Lite GGUF量化版或社区提供的Preview版Q8量化检查点。

许可证允许商用吗?

允许。主模型与配套权重均采用Apache 2.0许可证,商用无额外授权要求。

和Janus-Pro-7B相比怎么选?

Janus-Pro-7B侧重理解与生成的平衡,参数更小;U1.5-8B-MoT的文字渲染、4K输出与精细视觉控制更强,更适合海报、信息图等文字密集型商业视觉任务。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章