找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入Claude skills 从入门到精通 吴恩达亲授 AI Agent 核心技能2026 瞪哥公务员考试全攻略 行测申论一站式系统备考
Agent 文心智能蒸馏模型实战 90G 课程智泊 AI 大模型训练营 基于 LangChain 的 RAG 与提示工程实战构建企业级 AI 大脑:大模型微调与 RAG / Agent 全栈实战

6275

积分

1

好友

784

主题
发表于 昨天 23:24 | 查看: 0| 回复: 0

谷歌乘胜追击的速度有点快。Gemini 3 Pro 的好评还没散尽,最强文生图模型 Nano Banana 自己就迎来了 Pro 版。

自 Nano Banana 推出以来还没有对手真正追上来,谷歌干脆自己给自己升级。其他厂商恐怕连喘口气的时间都没有。

Nano Banana Pro 宣传界面:角色选择与漫画风格英雄插图

这波升级并不只是提升图像生成质量这么简单。Nano Banana Pro 的正式名称是 Gemini 3 Pro Image,它整合了 Gemini 3 Pro 的多模态理解能力和谷歌搜索知识库,能够理解现实语义与物理逻辑。

比如生成一张自行车维修保养注意事项海报,文字、步骤、版式都能和真实的保养常识对齐。

Nano Banana Pro 生成的自行车保养维护信息图

多张图片混合生成一直是 Nano Banana 的招牌技能,这次 Pro 版本直接把输入上限拉到 14 张。多人物角色、复杂场景下都能保持一致。

Nano Banana Pro 支持最多14张输入图片进行角色融合

文本渲染能力也在 Nano Banana 的基础上得到强化。结合多模态理解,模型可以把图片中的英文文字翻译成韩文、中文或其他语言,同时不破坏原有的设计风格。

Nano Banana Pro 图片文字多语言翻译保持设计风格

谷歌这次的操作很快在社交平台上传开:

Nano Banana Pro 让人感觉 AI 图像创作一夜之间迈入了新阶段。

网友评价:Nano Banana Pro 让 AI 图像创作升级

从创意到生产的完整工作流

先看文字渲染。相比上一代,Nano Banana Pro 不但能在图像中生成清晰可读的文字和艺术字,还支持多语言直接渲染。比如下面这些拟声词艺术字,以及藏在木头堆里的英文绕口令,排版质感都相当自然。

Nano Banana Pro 拟声词艺术字效果

Nano Banana Pro 生成带绕口令文字的图像

营销团队完全可以用它快速设计营销素材,跑创意迭代。下面这个 WAVE 字体项目,就从草图一路延伸到了 T 恤、棒球帽、咖啡杯和手提袋。

Nano Banana Pro 字体设计与品牌应用流程

这一能力的底层是 Gemini 3 Pro 的推理能力。模型不只理解图像内容,还理解文字语义,因此可以把语言转换任务做得既准确又不破坏设计。

另一个大突破是与 Google Search 的深度集成。这可不是简单地把搜索结果塞进图里,而是让模型基于搜索知识库和实时信息,生成准确的图表、地图与信息图。

你想做一份印度奶茶食谱图解,它不仅能输出漂亮的步骤图,还会确保配料比例和制作步骤不翻车。

Nano Banana Pro 生成印度奶茶制作步骤图

它还能给原本朴素的 PPT 页面做可视化升级。比如一张小沙发椅,从原料、生产到运输的全流程,模型会自动在地图上标注得清清楚楚。

Nano Banana Pro 将 PPT 供应链信息可视化

有了 Gemini 3 的高级推理加持,这种信息图的专业性又进了一步。像光的色散与重组,模型也能输出符合科学逻辑的说明图。

Nano Banana Pro 生成光的色散与重组科学示意图

再比如创建胰岛素-葡萄糖反馈回路的解释图。最终结果会按提示词的要求,用箭头表示胰腺(β/α 细胞)、肝脏与血液之间的通信方向,同时清楚标出高血糖和低血糖两种状态。

Nano Banana Pro 生成胰岛素-葡萄糖反馈回路解释图

创建营养级与能量转移的信息图时,它能直接生成带有生产者、初级消费者、次级消费者和三级消费者的生态金字塔,并附上 10% 能量转移规则说明。

Nano Banana Pro 生成营养级能量转移生态金字塔图

在分辨率和格式上,Nano Banana Pro 支持 2K、4K 高清输出,满足专业制作需求,宽高比覆盖从社交媒体方形图到 2.76:1 电影级超宽画幅。

Nano Banana Pro 支持 1K、4K 及多种宽高比输出

同时还可以自由调整图像的光线、镜头、对焦、色彩调校等物理属性和构图。

Nano Banana Pro 生成电影感镜头与自然场景

同样是光线调整,下面这组人像的明暗对比直接把画面逻辑掰了回来,观感确实很不一样。

Nano Banana Pro 光线调整重塑视觉逻辑

Nano Banana Pro 光线与色调调整案例

如果指定角色,模型还能快速产出贴合某个主题的定制化图片。以雪人为核心角色,聚焦“节日庆祝”主题,输入:

snowman celebrating the holidays doing a variety of festive activities

(雪人庆祝节日,进行各种节日活动)

它能把这个雪人放进滑雪缆车、雪地雪橇、宽扎节布置、厨房烤饼干、烛光晚餐等一系列场景中。

Nano Banana Pro 生成节日主题雪人图像

Nano Banana Pro 生成雪人节日活动多场景拼贴

这套工作流还把 Veo 3 视频生成模型拉了进来。你刚生成的图可以一键当关键帧,继续生成视频。

Nano Banana Pro 图像联动 Veo 3 视频生成

全面铺开:从开发者到普通用户都能用上

谷歌这次发布策略覆盖得很全,开发者和普通用户都有入口。

普通用户这边,模型会通过多个渠道提供。在 Gemini 应用中选择“创建图像”就能使用;免费用户有配额限制,超限后会回退到原版 Nano Banana。Google AI Plus、Pro 和 Ultra 订阅用户则可以拿到更高配额。

开发者这边,Nano Banana Pro 已经通过 Gemini API 在 Google AI Studio 和 Vertex AI 中提供。企业级用户还能用上预配置吞吐量、按需付费和高级安全过滤器等功能。

下面这张对比图也能看到新老两代模型的定位差异:Gemini 3 Pro Image 主打高保真,而 Gemini 2.5 Flash Image 更适合速度和成本敏感的场景。

Gemini 3 Pro Image 与 Gemini 2.5 Flash Image 对比

谷歌还在新的 AI 开发平台 Google Antigravity 中集成了这项技术,让编码代理直接使用图像生成能力产出详细的 UI 模型或新的视觉资产。Adobe Photoshop 和 Figma 等第三方设计工具也将陆续集成 Nano Banana Pro。

Nano Banana Pro 生成菜品图像并支持自然语言修改

最后是 AI 图像验证。Gemini app 中会推出基于 SynthID 数字水印技术的图像验证功能,用户上传图像后可以直接问:“这是 AI 生成的吗?”来确认是否由谷歌 AI 生成或编辑。

Gemini app 使用 SynthID 检测 AI 生成图像

官方表示,这个验证功能未来还会扩展到视频、音频以及搜索等平台。与此同时,即日起在 Gemini app、Vertex AI、Google Ads、Flow 中生成的 Nano Banana Pro 图像都会嵌入 C2PA 元数据。一句话总结:这些平台产出的图,都会自带可查来源和创作信息的“数字档案”。

官方 Blog: https://blog.google/technology/ai/nano-banana-pro/?utm_source=x&utm_medium=social&utm_campaign=&utm_content=

参考链接:

[1] https://x.com/GoogleDeepMind/status/1991522595129139486




上一篇:Linux KVM高危漏洞CVE-2026-89775:ARM64客户机可越界读写宿主机内存
下一篇:谷歌Gemini 4预训练启动!三款新模型齐发:3.6 Flash省Token、Cyber主攻漏洞
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-25 03:09 , Processed in 1.465329 second(s), 46 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表