一个模型干完理解生成编辑:SenseNova U1.5 预览版开源,8B 体量能本地跑

8 月 3 日前后,商汤把 SenseNova U1.5 的预览版开源了。我顺手扒了一下仓库和文档,越看越觉得这个路线有点意思——它不像大多数生图模型那样单独做一个扩散模型,而是把一个 8B 级别的模型塞进”原生统一多模态”的框里,理解、推理、生成、编辑全在一个模型里完成。对只想在自己机器上跑、又不想同时维护一堆不同模型的玩家来说,这种”一个模型干完所有活”的思路挺对胃口。

它到底是什么

SenseNova U1 系列基于商汤自研的 NEO-unify 架构。和常见的”挂个视觉编码器 + 套个扩散 decoder”的拼接式多模态不同,NEO-unify 从一开始就把语言和视觉信息当作同一个复合体来端到端处理,连独立的视觉编码器(VE)和变分自编码器(VAE)都去掉了。代价是结构更激进,好处是理解、生成、编辑之间不需要靠额外的 adapter 互相翻译,信息损耗小。

这次开源的 U1.5-8B-MoT(Preview)是 2026-07-31 放出来的预览权重,定位是”轻量多模态”。官方在文档里明确说,更完整的生产版本稍后会正式发布,所以现在拿到的是个早期看进展的窗口。它的几个主打点:

  • 原生 4K 生成:不是先出低清再超分,而是在模型内部直接生成高分辨率图,声称能同时保住全局结构和局部细节;
  • 纹理/材质/光照更真实:这点对做产品图、场景图的人比较有用;
  • 中英文文字渲染明显增强:复杂版式、密集排版更稳,官方演示里甚至能跑 1600+ 词超长 prompt 做”信息图”;
  • 图像编辑能力大步往前:指令跟随、主体一致性、未编辑区域保留都更强,还支持用 mask、边界框、视觉标记做区域可控编辑

授权是 Apache-2.0,权重和预训练启动脚本都给了,这点对想自己改、自己部署的人很友好。

SenseNova U1 架构能力雷达图

为什么说它适合”本地跑”

很多多模态生成模型一提到本地就让人头大:要么显存吃满,要么得配一整套推理服务。SenseNova U1 给了几条降低门槛的路,这是我比较看重的:

GGUF 量化权重。仓库里提供了 GGUF 量化 checkpoint(社区贡献的 Merger 量化版在 Hugging Face 上能找到),推理脚本加一个 --gguf_checkpoint 参数就能走量化 Linear 层加载,基础 --model_path 仍用于 tokenizer/config。显存不够又不想上大模型卡的人有救。

分层 offload 的 VRAM 模式。单卡低显存时可以用 --vram_mode 切换:full 全模型上 GPU(最快)、balanced 异步预取(比 low 快)、low 逐层 CPU<->GPU 同步交换(显存占用最小但最慢)。官方明确说这个分层 offload 比 Accelerate 的 CPU/磁盘 dispatch 快不少。

多卡自动切分。多 GPU 机器加 --device_map auto,Accelerate 会按可见显存自动把模块分上去,再配 --max_memory 锁定每卡预算。

推理依赖很轻:核心就 torch / transformers / pillow / numpy,可选 flash-attn。文本生图一句就能跑:

python examples/t2i/inference.py 
  --model_path sensenova/SenseNova-U1-8B-MoT 
  --prompt "A cinematic mountain village at sunrise" 
  --vram_mode balanced 
  --output output.png

想更快还能用 8-step 蒸馏预览版,加 --cfg_scale 1.0 --num_steps 8 就行,官方说画质和 base 接近。

SenseNova U1 示例图

有什么坑,先说在前

我还没在自己机器上真跑通(写这篇时只做了文档和仓库层面的核对),所以下面这些坑一部分来自官方文档明示,一部分是我自己预判的,标注清楚:

1. Preview 不是成品。文档自己写了”early look”,生产版本会更强。现在拿来做严肃生产要冒”过阵子被自己取代”的风险。

2. 8B-MoT 体量轻,但生图不是免费午餐。4K 原生生成对显存和算力都不客气。即便用 GGUF + balanced offload 能压进消费级显卡,速度会明显掉,别指望实时。

3. 推理路径和 vLLM/SGLang 不是一回事。它走的是 transformers + accelerate 的参考脚本,不是开箱即用的高吞吐服务。想接进现有生图工作台(比如本地 AI 操作台)大概率要自己包一层。

4. 中文复杂排版有进步,但别迷信。官方展示的 1600 词信息图很惊艳,那是挑过的 demo。真实业务里文字位置、对齐、换行仍然可能翻车,尤其小字号密集文字。

5. U1.5 偏生成/编辑,理解侧能力看具体版本。统一架构听着全能,但 Preview 重点在”图像生成与编辑的跃迁”,理解/推理侧的实测还得等社区反馈。

SenseNova U1 可视化

值不值得现在上车

我的判断:把它当”本地轻量多模态试验田”很值,当”主力生图生产工具”还早。

如果你本来就愿意折腾本地模型、手上有张能跑 8B 级别的卡(或者愿意用 GGUF + offload 在更小显存上慢慢等),Apache-2.0 + 轻量 + 统一架构这个组合,比再单独拉一个生图模型、一个理解模型、一个编辑模型要省心。尤其”区域可控编辑”和”长 prompt 信息图”这两个能力,对做素材、做演示图的人有实打实的吸引力。

如果你只是想要个稳定出图的工具、现在就要用,那建议等 U1.5 的正式生产版,或者直接看社区用 GGUF 量化后的实际出图评测再决定。Preview 阶段的预期管理很重要——它展示的是方向,不是终点。

我自己的计划是先拉 GGUF 量化版在本地小显存机器上跑通 t2i 和 editing 两条脚本,确认 4K 和区域编辑的实际观感,再决定要不要接进日常流程。跑通了下次单独写一篇实操记录。

发表评论