找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4201

积分

0

好友

553

主题
发表于 4 小时前 | 查看: 4| 回复: 0

刚刚,新出的一个生图模型着实有点东西:国产的,4K直出的,开源的,轻量的,还可以指哪儿改哪儿

比如这张信息密度超高的图片,就是它做出来的:

人工智能工程发展时间线——从达特茅斯到物理信息神经网络,里程碑事件图谱

即便把图片放大了看,文字与图形元素的细节依旧拉满。

再如这组充满艺术感的视觉大片,这个 AI 也是信手拈来:

左侧抽象艺术与右侧女性拼贴画组合,背景融入化学分子与文字

那它是何方神圣?

正是商汤刚刚面向社区开源的 SenseNova U1.5-Lite-Preview

这是一个轻量级原生统一多模态模型的早期预览版本。它延续了商汤自研的NEO-Unify 架构,把语言、视觉语义和像素生成整合进同一套模型,覆盖视觉理解、推理、生成与编辑。

不过,原生 4K 直出还只是亮点之一。
在仅 8B-MoT 参数的轻量身形下,U1.5-Lite-Preview 做到了:

  • 复杂 Prompt 能接住:支持长篇、多约束、层次化和结构化的视觉指令;
  • 文字与版式更出色:面向海报、信息图、品牌视觉等高信息密度内容;
  • 生成后还能继续改:支持参考图、多图组合、局部文字编辑,以及红框、坐标和 marker 等精准编辑。

在实际创作中,“会画图”只是第一步,真正决定它能否进入创作流程的,还得看复杂任务和编辑能力。那么这个 8B-MoT 小模型用起来究竟有多顺手?我们接着往下看。

能 Hold 住复杂创作和编辑才是重点

先来看一张信息密度相当高的图。

银盐摄影原理与流程科普信息图,复古手绘风格解析相机结构、显影定影步骤及胶片颗粒感

这张图的主题是银盐摄影。
正中央是一台被拆解开的复古相机,镜头、快门、胶片仓、卷片轴、取景器等结构一层层摊开,一束橙色光线从镜头打进来,顺着成像路径穿过画面,视觉中心立得明明白白。

这类图最难的地方不在于“画一台相机”,而是模型得同时把时间线、知识模块、结构拆解、流程说明和视觉层级组织进同一张图,还要让人一眼看出哪里是主干、哪里是补充。从最终效果看,U1.5-Lite-Preview 在高信息密度任务上已能将内容与版式一起接住——黑白蚀刻风格统一,主视觉醒目,细节丰富,整张图不乱,反而有种“越看越有东西”的感觉。

如果说上一张是在考“从零做一张复杂信息图”,那接下来这组更像是在检验模型复刻逻辑,再重新输出的能力

流行影视时间线与邮政邮件旅程对比,左侧输入图展示影视里程碑,右侧输出图展示邮件投递流程

输入图主题为 “Modern Pop Culture Film & TV Milestone Journey”,几部流行作品在手绘水彩风格的弯曲路径上串联,就像一张轻松的文化路线图。
输出图主题换成了 “The Journey of Postal Mail”——邮政邮件的旅程。
但你仔细看,那条弯曲轨迹还在,节点节奏也在,左中右的版式关系依旧保留。原先围绕电影剧集的内容被整体替换为“投递、分拣、运输、派送”四个环节,元素换成了邮筒、分拣中心、运输车和邮差上门。

换句话说,它领悟的不只是“画风”,更是一整套设计框架和组织方式。

真正的内容生产中,从头做图只占一部分时间,更折磨人的往往是改稿。来看这个博物馆文创的例子:

博物馆文创开发流程对比:左右两图均展示研究挖掘到反馈迭代六步骤,右侧水印‘企微号:重子位’

输入图和输出图主题都是博物馆文创开发流程。大框架没变:左侧竖排标题,中间巨大的艺术字样,右侧六步流程,底部价值模块,米色浅棕调性全都保留。
但画面最核心的主视觉被换了——就像真实工作流里常见的改法:文案不大改,结构不重做,但客户要求主题方向一变,主视觉就得调整,气质也要跟着走,信息框架尽量守住。
U1.5-Lite-Preview 已经开始具备这种能力:不是简单塞进一件新文物,而是在保留原有流程信息图框架的前提下,让新的核心元素重新融入整体设计语言。

再来一个更刁钻的:把很有设计感的“迎”字改成“命”字。

创意海报:左侧蓝色海面上白船浪花组成‘卫’字,右侧相同场景浪花组成‘命’字,配有‘青春就是一场旅游’手写体

结果里,原有船体继续充当“命”字的最后一竖,周围浪花重新组织了其余笔画。新字宛如从海面自然生长出来,毫无生硬贴图感。

除了在一张图上修修改改,U1.5-Lite-Preview 还能同时读取多张参考图
比如这个韩式双拼炸鸡案例:输入两张图,一张手绘食谱模板提供版式与画风,另一张实拍照片提供食物内容。

左上:炸鸡实物照片;左下:水煮麻辣鱼食谱插画,标注难度耗时及步骤

按要求设计后,输出如下:

韩式双拼炸鸡手绘食谱插画:封面小猪卡通,六步骤图解制作过程,配有成品图与小贴士

U1.5-Lite-Preview 把照片中的原味炸鸡、甜辣炸鸡和可乐重新画进了米色网格笔记本,左侧黑色螺旋装订、手写标题、卡通小猪以及六个烹饪步骤一应俱全。最终成品是一张能直接用于社交媒体传播的手绘食谱,真实照片与插画模板之间没有出现风格割裂。

类似的能力落到办公场景里,还可以将一张普通人物照片直接变成单栏简历。

人物照片与简历设计对比:右侧深色信息卡片展示林晓晓的设计师履历、工作经历和技能条

人物头像放在顶部,原图中的三角梅继续作封面视觉,玫粉与米白配色顺势延展,姓名、职位、联系方式、工作经历和技能条依次排开。

至于前面提到的指哪改哪,红框和 marker 都能派上用场。

最简单的情况下,你可以圈出信息图里的 “35+MIN”,让模型仅将其改为 “25MIN”,保持原有字体、字号和排版,并最后把定位红框移除。

移动预点餐对比海报:左侧旧方式等待35+分钟,右侧新方式等待25分钟,突出节省时间

对着复杂一点的要求,甚至可以直接改变画面氛围。

日落帆船与血月场景对比:输入图标注了氛围修改指示,输出图呈现红月、浓雾与暗调夜景

原图是金色满月下的暖色帆船,我们只需在图上留下 marker 和修改要求,U1.5-Lite-Preview 就会把满月换成深红色血月,叠上一层浓雾,并把天空、湖面与帆船的光线全调整为暗调夜景。尽管月亮、雾气和光影全变了,帆船、人物和背景树林仍稳在原来的位置。

这一大一小两种修改正好对应两类编辑需求:前者追求精准,最好只动几个字符;后者需要模型重新处理色调、光线和空间关系,还得尽可能稳住画面主体。

看到这里,U1.5-Lite-Preview 所展示的已不止于画图。它开始理解一张图里的主体、版式、风格和空间关系,也开始判断用户想动哪里、哪些地方最好别碰。

怎么做到的?

这些各不相同的能力,都沿着同一条技术路线长了出来。

SenseNova U 系列采用NEO-Unify 原生统一多模态架构,在同一模型里将语言、视觉语义与像素生成共同建模。于是,从读懂指令、分析参考图,到判断该怎么改、最终生成像素,可以在同一套架构里完成。

这套设计在图像编辑中尤其关键。比如把“迎”改成“命”,模型要先理解文字造型由船和浪花共同构成,再找到需要重构的区域,再判断飞鸟、海面和上下文字应该保留。血月案例也一样:月亮、雾气和光照需要整体变化,帆船与人物的主体结构则要尽量稳定。一边动手,一边分辨哪里不能乱动,这才有了持续编辑的基础。

为了把分辨率进一步推到 4K,商汤还重新设计了生成头,减弱视觉 Token 网格对最终画面的影响,并把训练扩展到 4K 分辨率。这样一来,画面放大后,纹理、材质和光影更经得起审视,常见的网格感、拼接痕迹与纹理断裂也随之减少。

长 Prompt 的控制力则由 Prompt Enhance 进一步增强。日常生图用一句自然语言就能开工;到了海报、信息图和品牌视觉这类复杂任务,用户可以把布局、风格、文字、比例乃至禁止项逐层写清楚,让模型尽可能同时接住。所以,长 Prompt 并非刻意抬升门槛,而是提供更高的创作控制上限。

再从评测榜单看,相较上一代 U1,U1.5-Lite-Preview 在 Qwen-Image-Bench 上的成绩从 47.14 提升至 55.20(with Prompt Enhance),作为一个轻量级开源模型表现相当优秀。

Qwen-Image-Bench 性能柱状图:多个模型得分对比,GPT Image 2 以64.96居首,Qwen Image 2* 为55.66,SenseNova-U1.5-Lite-Preview* 为55.20

同时,ImgEdit-Bench 从 3.90 升至 4.37;在 GEdit-Bench 上,英文项由 7.47 升至 8.17,中文项由 7.42 升至 8.05。在技术宣发展示的 WeEdit 榜单中,U1.5-Lite-Preview 的 Overall Average 达到 6.44。

GEdit-Bench 性能对比图表:EN_G_O 与 CN_G_O 子图分别展示各模型英文和中文编辑得分

有点接近一套视觉工作台了

再回头看这次升级,4K 确实亮眼,却难以独自撑起一套生产流程。真实的视觉工作往往从第一版出图之后才开始——标题换一句,产品挪一下,人物得保留,整体光线再暗一点,客户临时又要加个元素……过去遇到这些修改,要么重新生成碰运气,要么回到专业软件里继续处理。

但当模型能够理解眼前这张图,并顺着用户反馈一轮轮往下改,AI 生图才开始真正靠近内容生产和设计工作流。统一多模态架构的价值,也在这个过程中变得更加容易感知:视觉理解、推理、生成和编辑不再分别躺在技术说明里,它们最终落地成了看懂参考图、保住人物、换掉标题、重排版式和局部修改这些具体动作。

当然,U1.5-Lite-Preview 依然只是一个早期预览版本。短 Prompt 理解、小字与人像细节、整体美学一致性以及复杂场景编辑的稳定程度,都还有继续提升的空间。据了解,U1.5 的正式版很快就会开源;届时这些问题应当都会得到更好的解决。现在,商汤把轻量版面向社区开源,也意味着这些能力和问题都将更早进入开发者与创作者的真实工作流里接受检验。

如果你对统一多模态架构或图像生成背后的技术细节感兴趣,可以在 云栈社区 上与更多开发者交流探讨。

总而言之,4K 决定了一张图能放多大,而 AI 的理解和编辑能力,才决定它能走多远。

开源地址:
GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
魔搭社区: https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview




上一篇:大模型的下半场:拼的是记忆,RAG之后AI原生记忆如何落地?
下一篇:DeepSeek V4 Flash 0731正式版发布:5分钱生成3D射击游戏 Agent能力暴涨
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-4 05:53 , Processed in 0.745542 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表