
模型越大越聪明?商汤这次偏要反着来。6月24日,他们开源的SenseNova U1.5Lite,一个只有8B参数(80亿)的轻量级多模态模型,愣是在图片生成和编辑上打出了“越级”表现——跟同级别的比,它几乎是全面碾压;跟那些动辄千亿参数、成本高昂的商业大模型比,它也在复杂排版和文字渲染上追到了同一水平线。
说人话就是:以前你想让AI生成一张海报,要么得求助于收费高昂的大模型,要么用免费小模型但结果常常“有图但没灵魂”——主体画对了,背景糊了,中文字全是乱码。现在商汤把这个短板补上了,小模型也能干出细腻活儿。
怎么做到的?关键在“原生”两个字。其一是原生高分辨率输出,它不需要像其他模型那样先生成小图再用AI脑补放大,而是直接输出最高4K的图片,而且在大画幅下依然保得住细节——衣服的织物肌理、玻璃杯上的反光、海报上细如蚁脚的文字,都不容易崩。其二是原生多约束处理能力,它一口气能吞下3至4K的上下文长度,意味着你可以在一句话里同时下达“画面左边有三只橘猫,右边站着一个戴红围巾的男人,背景是雪天街道,风格要像宫崎骏动画,画面中央还要加上‘冬日快乐’四个大字”这种复杂指令,它都能逐一拆解并执行到位,不用分好几次生成再自己拼图。
在图像编辑这个更考验功力的场景里,SenseNova U1.5Lite也做了针对性加固。比如你想把照片里的人物换件衣服,或者把海报上的中文换成英文,它可以通过Bounding Box(画框框)或Visual Marker(涂色块)的方式指定编辑区域,改完后的部分和原图的光影、材质、透视关系都保持一致,不会出现“头上换了一个身体”的诡异拼贴感。对于信息图、品牌视觉这类要求版式严谨的活儿,它也能维持版面结构,不把整页内容“改写”得面目全非。
这事对普通人和中小开发者的意义更大。以往能优雅处理复杂视觉任务的模型,要么藏在云服务里按次收费,要么需要部署在一个机房那么大的服务器集群上。SenseNova U1.5Lite开源之后,加上它轻量级的体积,意味着普通开发者用一张消费级显卡就能跑起来,直接免费且私有化地开发海报生成工具、电商主图编辑插件、短视频分镜助手等各类应用。大模型技术普惠的路子,又多了一条支干。
商汤这次选择把“轻量但全能”的模型开源出来,不只是在秀技术肌肉,更是在给整个行业探路:这场大模型竞赛的胜负手,可能正从“谁的参数堆得高”转向“谁能在小身躯里塞进大智慧”。而这条赛道的起跑枪,刚刚被商汤打响了。