生图模型若只能「抽卡」,却改不准海报左下角一行地址,就进不了设计师的时间线——SenseNova U1.5 Lite把验收标准从惊艳单帧,推向生成—修改—交付的完整链路。对开发者而言,8B统一模型意味着部署轻、调用链短,但能不能扛住多参考合成与信息图排版,才决定它是不是生产力工具。
商汤科技是人工智能软件公司,SenseNova为其多模态大模型产品线。SenseNova U1.5 Lite于8月25日前后发布正式开源版本,距Preview约三周。模型保持约8B参数体量,延续NEO-unify原生统一多模态架构——视觉理解、图像生成与编辑共用一套模型,而非理解、生成各挂一个模型再手工拼接。公开材料强调正式版在以下方面较Preview进一步强化:3–4k字符级复杂指令遵循;视觉完成度与材质光影;原生编辑时对非编辑区域的保持;中英文文字、海报与信息图排版;框选、标记与多图参考等精细控制;原生4K高分辨率输出。
训练与部署路径:
所谓统一多模态,白话是模型在动像素之前先「看懂」画面——主体在哪、文字在哪、用户框选的是哪一块——再决定生成或编辑,而不是生成后再靠外部工具硬修。MOPD(多教师在线策略蒸馏)白话是先让几位「单科老师」把字写好、构图练好、局部改图练好,再把本领收进一个班统一上课,用户侧只面对一个模型接口。
公开样例覆盖九图美食拼贴、卧室局部材质替换、可可豆到巧克力信息图、社交媒体封面、社区厨房信息图仿照参考版式、Radiohead海报多参考合成,以及展览海报左下角中英文地址批量替换等——难点均在「改指定处、留其余处、排版不塌」。
产业观察上,闭源头部模型仍占审美上限,但开源8B若能在编辑保持与文字排版上稳定进工作流,抢的是广告预演、电商素材与运营海报的「改第八版」时间,而不是电影节海报的「第一次惊艳」。可以把它想成:模型厂商从卖「一张能发朋友圈的图」,转向卖「一张能过客户法务与品牌规范的图」。对采购方,应抽检同一角色跨镜头一致性、4K小字可读性与失败重试成本,而不是只看官方精选样张。
需要把边界读清楚。与闭源GPT-Image-2等的对比多来自厂商自述与样例,第三方独立基准仍有限;复杂商业片全流程仍依赖人工精修。下一观察点是API SLA、垂直行业模板与社区微调案例能否在一个月内出现可复现工单。