
一张图生成得漂亮,并不代表它能进入企业设计流程。真实交付更难:提示词可能长达数千字,要同时约束主体数量、空间关系、中文排版和品牌风格;修改一个杯子时,人物的脸和背景不能一起漂移;同一版物料还要反复迭代,而不是每次从头抽卡。商汤在8月21日开源SenseNova U1.5,瞄准的正是从“出图”到“持续修改”的断层。
SenseNova U1.5-8B-MoT沿用NEO-unify原生统一架构,让文字和像素在同一系统中编码与解码。正式版重点补强六类能力:图像质量、中英文文字与信息图、原生4K、图像编辑、复杂指令遵循,以及Bounding Box和Visual Marker等区域控制。它还提供单图、多图参考与多轮修改,目标不是一次生成最惊艳的样张,而是让上一步结果能够可靠地成为下一步输入。
对企业来说,这比排行榜上的一处领先更实际。电商海报需要保留商品身份,只换背景和价格区;制造说明图要固定结构,只改局部标注;品牌物料要在不同地区替换文字,却保持版式、配色和视觉层级。只要未编辑区域能够稳定保存,AI才可能从创意草图工具进入可审阅、可返工的生产链。
常见视觉工作流会把提示词扩写、文字渲染、图像生成、局部编辑和高分辨率放大交给不同模型,再用路由器拼接。每次切换都会带来额外显存、时延和风格漂移。SenseNova选择在训练阶段培养不同专家,再通过MOPD策略蒸馏把能力合入一个交付模型,希望用一次推理同时处理语义理解与像素生成。
开源材料已经给出Transformers推理脚本、LightLLM与LightX2V部署指南,以及面向生成、编辑、理解和交错图文的示例。Apache 2.0许可证也降低了企业验证门槛。另一个实用信号是8步LoRA:团队可以先用更少采样步数测试吞吐和质量,再决定是否切到完整流程,而不是一开始就押注高成本部署。
这里最容易产生误解的是体量。产品名中的8B-MoT不能简单理解为“只有8GB显存就能跑”。模型仓库的张量元数据显示约175亿参数,魔搭完整存储约50GB;标准环境还使用Python 3.11、PyTorch 2.8与CUDA 12.8。量化版正在准备,团队部署前仍要实测显存峰值、首图时延、4K吞吐和并发成本。
能力边界也写得很明确:密集小字和中英混排仍可能出错,复杂布局的精确数量与对齐不稳定,小脸、手部和肢体细节可能失真,多区域、多参考图的连续编辑仍会漂移。现有性能图主要来自项目方公布的多项基准,U1.5独立技术报告和完整训练链尚未释放,采购或私有化不能只看示例图。
ATYUN认为,SenseNova U1.5最值得观察的并不是原生4K,而是它是否能把可控修改做成稳定能力。企业视觉成本常常不在第一张图,而在第十次改字、换人、保留版式和跨渠道适配。一个能被FDE嵌入审核、版本管理与品牌规则的模型,价值会明显高于只负责首轮灵感的生成器。
更合理的试点方法,是选一类高频物料,建立文字准确率、主体保持度、非编辑区域变化率、人工返工分钟数和单张成本五组指标;再用真实品牌模板测试多轮修改。若它能在三到五轮编辑后仍守住结构和文字,开源权重才真正转化为企业生产力。团队还应保留失败样例,按文字、布局、身份漂移和局部编辑分类回归,而不是只展示成功作品。还要把修改前后的素材版本化保存,确认模型更新不会破坏旧流程。否则,4K只是更大尺寸的返工。
