找回密码
立即注册
搜索
发回帖 发新帖

6332

积分

0

好友

804

主题
发表于 14 小时前 | 查看: 2| 回复: 0

今年 5 月,Claude Code 团队的 Thariq 发过一篇文章,核心观点是: HTML is the new markdown 。他几乎不再写 Markdown 了,计划、方案、报告都让 Claude Code 直接生成 HTML。原因很直接:超过一百行的 Markdown,他自己都读不下去。

到了刚过去的国庆节,Karpathy 也发了类似的观点:与其让模型写一大段文字,不如让它画图,或者直接输出 HTML 网页。

不过,这些都还停留在提示词技巧层面:你得记得每次跟模型说一句“用 HTML 输出”。这次 GPT-6 推给了所有 ChatGPT 用户,同时带来了一个叫 Intelligent UI 的功能,又往前走了一步。ChatGPT 回答里直接就能生成图表、按钮、表单,甚至一个能玩的小游戏。模型会根据问题自己判断要不要出界面,不再需要特殊的提示词。

我试了一些场景,也踩了个坑:专门让它“用 Intelligent UI”,它反而还是像以往那样输出大段文字。所以,今天的内容就来聊聊这个 Intelligent UI。

Intelligent UI 是什么?

按照 OpenAI 博客的说法,Intelligent UI 背后是两样东西:一个是原生的界面组件库,支持流式输出,模型从里面挑组件拼出回答;另一个是编译器,模型一边生成,界面一边渲染,不用等整段回答写完。

这跟 Thariq 那种用法不太一样。在 Claude Code 里让模型输出 HTML,是从一张白纸开始写代码,想要什么效果都行,但每次都得从头写一遍样式和交互逻辑。Intelligent UI 的积木是 OpenAI 提前做好的,是内置在 ChatGPT 界面中的一部分,模型只管挑合适的积木来搭。

OpenAI 设计师 Andrew Chen 提到,模型早就能写出好看的 HTML 了。生成式 UI 难的是另外两件事:让界面看起来本来就属于 ChatGPT,以及让模型判断什么时候真的需要界面,什么时候一段文字就够了。

拿 OpenAI 官方博客的复古游戏为例,提示词就一句 Create a retro interactive gaming console that I can play,出来的是一台 1989 年风格的掌机。屏幕上能切换贪吃蛇、打砖块和乒乓三个游戏,方向键、 A/B 键也都可以正常操控。

GPT-6 Intelligent UI 生成的复古游戏控制台界面

这句提示词一个字没提 Intelligent UI,但要什么风格、要个什么东西、要能玩,都说清楚了。

那我开头踩的那个坑,问题出在哪儿呢?

怎么触发界面

刚尝试这个功能的时候,我想让它讲讲 Transformer 的工作原理,提示词写的是“用 Intelligent UI 帮我理解 Transformer 的工作原理”。结果它还是照常给了一大段文字。

我把提示词换成“用可视化交互界面帮我理解 Transformer 的工作原理”,只改了这几个字,界面就直接出来了:

Transformer 工作原理可视化交互界面

它把 Transformer 拆成了四步:Token 变向量、Self-Attention、FFN 加多层、预测下一个词,每一步都能点开查看更详细的图示界面。比如在 Self-Attention 这一步,点一下“我爱吃苹果”里的“吃”,右边的注意力矩阵就会显示它对其他词的权重,下面还配了 Q、K、V 各管什么,以及注意力的计算公式。

其实帮助文档里写了,Intelligent UI 不需要特殊提示词,出不出界面是模型根据问题自己判断的。你只说“用 Intelligent UI”,它也不知道你到底想要什么样的界面。

那怎么写才管用呢?把界面本身描述出来:要一个什么东西,上面有什么控件,改了之后什么跟着变。比如下面几个例子,效果都不错:

提示词 出来的界面 说清了什么
Create an ocean dive with a depth slider, changing light+pressure, and clickable creatures 带深度滑块的潜水场景 场景、控件、联动、可点的元素
teach me orbital mechanics without giving me code 轨道模拟器,能调速度、质量、距离和发射方向,轨道实时更新,还会显示坠毁和逃逸 学习目标,外加“不要代码”
break down the design of a 7-speed bike 自行车结构图,车架、车轮、传动、刹车、车把五个系统可以分别点开 一个“拆解”的动作

轨道力学那条提示词很短,但后半句很关键。这类问题模型很容易直接甩一段模拟代码给你,我猜加上“不要代码”,就等于把这条路堵死了。

想让它平时多出界面的话,也可以在 ChatGPT 自定义指令(Custom Instructions)里写上偏好。不过官方也说了,偏好只是引导,具体布局每次都可能不一样。

还有哪些坑?

除了触发问题,使用中还有几个地方要注意。

第一个是 Pro 档反而用不了。Intelligent UI 只支持 Instant 到 Extra High 这几档,最高的 Pro 档用的是 GPT-6 Astra,并不支持。另外,Work 标签页、语音模式和旧版桌面客户端也都用不了,建议直接用网页版。

第二个是界面关不干净。ChatGPT 网页版设置里可以把 Layout and visuals 调成简洁,但只会减少视觉元素,不会切回纯文本。偶尔不想要界面的话,直接在对话里说“只用文字回答”更省事。

第三个是做出来的工具留不住。组件状态换一个对话就没了,也没法单独分享给别人。这也是它跟 HTML 文件差距最大的地方:HTML 发个链接其他人就能打开。

第四个是错误答案更难发现。一个排版漂亮的计算器摆在面前,很少有人会去检查背后的公式。涉及钱的计算,最好让它把公式和假设一起列出来,自己核对一遍。

写在最后

模型越来越强大,写代码的成本也越来越低。以前根本不值得专门做的小工具,现在可以随手生成,用完就扔了。Intelligent UI 把这件事变成了 ChatGPT 的默认能力,只要把想要的界面说清楚,就能拿到一个能点能拖的交互式界面。

不过做出来的东西留不下来。想弄懂一个技术原理、临时要个小工具,交给 Intelligent UI 很合适;要保存、要分享、要反复改的方案和报告,我还是更建议在 Claude Code 或 Codex 里让 Agent 直接生成 HTML 更容易共享。

相关链接:

如果你也在用这类 AI 工具做小实践,欢迎到云栈社区和更多开发者一起交流。




上一篇:从 Claude 全面迁到 GPT-6 + Codex:10 条踩坑经验分享
下一篇:Kubernetes 多租户集群安全部署 AI Agent 架构设计与治理实践
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-11 19:11 , Processed in 0.062884 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表