今年 5 月,Claude Code 团队的 Thariq 发过一篇文章,核心观点是: HTML is the new markdown 。他几乎不再写 Markdown 了,计划、方案、报告都让 Claude Code 直接生成 HTML。原因很直接:超过一百行的 Markdown,他自己都读不下去。
到了刚过去的国庆节,Karpathy 也发了类似的观点:与其让模型写一大段文字,不如让它画图,或者直接输出 HTML 网页。
不过,这些都还停留在提示词技巧层面:你得记得每次跟模型说一句“用 HTML 输出”。这次 GPT-6 推给了所有 ChatGPT 用户,同时带来了一个叫 Intelligent UI 的功能,又往前走了一步。ChatGPT 回答里直接就能生成图表、按钮、表单,甚至一个能玩的小游戏。模型会根据问题自己判断要不要出界面,不再需要特殊的提示词。
我试了一些场景,也踩了个坑:专门让它“用 Intelligent UI”,它反而还是像以往那样输出大段文字。所以,今天的内容就来聊聊这个 Intelligent UI。
Intelligent UI 是什么?
按照 OpenAI 博客的说法,Intelligent UI 背后是两样东西:一个是原生的界面组件库,支持流式输出,模型从里面挑组件拼出回答;另一个是编译器,模型一边生成,界面一边渲染,不用等整段回答写完。
这跟 Thariq 那种用法不太一样。在 Claude Code 里让模型输出 HTML,是从一张白纸开始写代码,想要什么效果都行,但每次都得从头写一遍样式和交互逻辑。Intelligent UI 的积木是 OpenAI 提前做好的,是内置在 ChatGPT 界面中的一部分,模型只管挑合适的积木来搭。
OpenAI 设计师 Andrew Chen 提到,模型早就能写出好看的 HTML 了。生成式 UI 难的是另外两件事:让界面看起来本来就属于 ChatGPT,以及让模型判断什么时候真的需要界面,什么时候一段文字就够了。
拿 OpenAI 官方博客的复古游戏为例,提示词就一句 Create a retro interactive gaming console that I can play,出来的是一台 1989 年风格的掌机。屏幕上能切换贪吃蛇、打砖块和乒乓三个游戏,方向键、 A/B 键也都可以正常操控。

这句提示词一个字没提 Intelligent UI,但要什么风格、要个什么东西、要能玩,都说清楚了。
那我开头踩的那个坑,问题出在哪儿呢?
怎么触发界面
刚尝试这个功能的时候,我想让它讲讲 Transformer 的工作原理,提示词写的是“用 Intelligent UI 帮我理解 Transformer 的工作原理”。结果它还是照常给了一大段文字。
我把提示词换成“用可视化交互界面帮我理解 Transformer 的工作原理”,只改了这几个字,界面就直接出来了:

它把 Transformer 拆成了四步:Token 变向量、Self-Attention、FFN 加多层、预测下一个词,每一步都能点开查看更详细的图示界面。比如在 Self-Attention 这一步,点一下“我爱吃苹果”里的“吃”,右边的注意力矩阵就会显示它对其他词的权重,下面还配了 Q、K、V 各管什么,以及注意力的计算公式。
其实帮助文档里写了,Intelligent UI 不需要特殊提示词,出不出界面是模型根据问题自己判断的。你只说“用 Intelligent UI”,它也不知道你到底想要什么样的界面。
那怎么写才管用呢?把界面本身描述出来:要一个什么东西,上面有什么控件,改了之后什么跟着变。比如下面几个例子,效果都不错:
| 提示词 |
出来的界面 |
说清了什么 |
Create an ocean dive with a depth slider, changing light+pressure, and clickable creatures |
带深度滑块的潜水场景 |
场景、控件、联动、可点的元素 |
teach me orbital mechanics without giving me code |
轨道模拟器,能调速度、质量、距离和发射方向,轨道实时更新,还会显示坠毁和逃逸 |
学习目标,外加“不要代码” |
break down the design of a 7-speed bike |
自行车结构图,车架、车轮、传动、刹车、车把五个系统可以分别点开 |
一个“拆解”的动作 |
轨道力学那条提示词很短,但后半句很关键。这类问题模型很容易直接甩一段模拟代码给你,我猜加上“不要代码”,就等于把这条路堵死了。
想让它平时多出界面的话,也可以在 ChatGPT 自定义指令(Custom Instructions)里写上偏好。不过官方也说了,偏好只是引导,具体布局每次都可能不一样。
还有哪些坑?
除了触发问题,使用中还有几个地方要注意。
第一个是 Pro 档反而用不了。Intelligent UI 只支持 Instant 到 Extra High 这几档,最高的 Pro 档用的是 GPT-6 Astra,并不支持。另外,Work 标签页、语音模式和旧版桌面客户端也都用不了,建议直接用网页版。
第二个是界面关不干净。ChatGPT 网页版设置里可以把 Layout and visuals 调成简洁,但只会减少视觉元素,不会切回纯文本。偶尔不想要界面的话,直接在对话里说“只用文字回答”更省事。
第三个是做出来的工具留不住。组件状态换一个对话就没了,也没法单独分享给别人。这也是它跟 HTML 文件差距最大的地方:HTML 发个链接其他人就能打开。
第四个是错误答案更难发现。一个排版漂亮的计算器摆在面前,很少有人会去检查背后的公式。涉及钱的计算,最好让它把公式和假设一起列出来,自己核对一遍。
写在最后
模型越来越强大,写代码的成本也越来越低。以前根本不值得专门做的小工具,现在可以随手生成,用完就扔了。Intelligent UI 把这件事变成了 ChatGPT 的默认能力,只要把想要的界面说清楚,就能拿到一个能点能拖的交互式界面。
不过做出来的东西留不下来。想弄懂一个技术原理、临时要个小工具,交给 Intelligent UI 很合适;要保存、要分享、要反复改的方案和报告,我还是更建议在 Claude Code 或 Codex 里让 Agent 直接生成 HTML 更容易共享。
相关链接:
如果你也在用这类 AI 工具做小实践,欢迎到云栈社区和更多开发者一起交流。