
商汤科技今天扔出了一颗不大不小的炸弹:一款只有8B参数的轻量多模态大模型SenseNova U1.5Lite正式开源。别看它体积小,在视觉任务上不仅把同级别的对手甩在身后,有些复杂排版和文字渲染的活儿,甚至能跟那些超大规模商业模型打个平手。
这款模型最大的亮点,是它原生支持3到4K的上下文长度。什么意思?就是你丢给它一张高分辨率图片,同时提出一串要求——“把左边第二个人的红衣服换成蓝的,背景换成傍晚的海滩,再加上一行居中的白色标题”,它能一次性消化所有指令,稳稳当当地把图改出来,不用你分步操作,也不会改着改着就把无关区域弄花了。
在具体能力上,这次升级有几个值得关注的细节。
首先是出图质量。以前的AI生成图片,经常出现局部细节很精致、整体构图却崩掉的情况——比如人脸画得完美但手指多了一根。U1.5Lite在整体构图、色彩、光影、材质这些维度上做了大幅修正,输出画面的完成度明显上了一个台阶。
其次是图像编辑更“听话”了。过去你用AI改图,最头疼的就是它分不清哪些该改、哪些该留。这个模型增强了对主体身份、空间结构、非编辑区域的保持度,意味着你可以指定“只改这里,其他别动”,它在执行局部修改、元素替换、文字精修、多参考图编辑时的表现都更可靠。
文字和排版也是这次的重头戏。无论是中英文混排的海报、信息图,还是品牌视觉设计,它都能把文字渲染得清晰美观。以前AI生成文字经常缺胳膊少腿、拼错单词,U1.5Lite在这方面专门下了功夫,让生成内容从“一张好看的图”进化到“一套完整的视觉表达”。
控制方式也给了更多选择。你可以用Bounding Box框出要修改的区域,也可以用Visual Marker做标记,还支持单图、多图参考——把几张图一起丢给它,它能理解各图之间的关系,再综合执行编辑。
最让人意外的是它实现了原生4K分辨率输出。高分辨率生成向来是轻量模型的软肋,不是细节糊掉,就是生成速度慢得离谱。U1.5Lite在4K下既能hold住宏观构图,还能照顾到细微的肌理纹理、微小的文字和光影折射效果。
目前项目已经开源,代码和模型都挂在GitHub上,感兴趣的开发者可以直接上手体验。
轻量模型做到这个份上,背后传递的信号其实很明确:多模态大模型的竞争,已经从单纯拼参数规模,转向拼效率、拼精准度、拼落地能力。8B的模型能干成这件事,对那些被算力成本卡住脖子的中小团队来说,无疑是个好消息。商汤这一步棋,可能正在把本该属于巨头的高端视觉能力,悄悄搬到所有人的桌面上。