仅靠“卷模型”显然已经无法满足 OpenAI 的胃口了。10 月 7 日,OpenAI 宣布将 GPT-6 进一步开放给 ChatGPT 的全部用户,同时率先面向付费用户推出了一项新功能——Intelligent UI(智能界面)。
比起 GPT-6 在推理、编程等常规项目上的升级,我对这个“小功能”更感兴趣。原因并不复杂:ChatGPT 诞生快四年了,大模型的能力早已今非昔比,但我们与 AI 打交道的方式,却始终没有太大变化。
业界也早已意识到,纯文字的 Chatbot 不可能是 AI 交互的最终答案。去年 Google 在 Gemini 3.0 上探索生成式 UI,蚂蚁灵光也尝试让 AI 即时生成可交互的界面与应用。现在,OpenAI 也给出了自己的答案。

(截图来源:ChatGPT)
简单来说,在新版 ChatGPT 中,GPT-6 不仅会根据问题生成文字、图片或表格等内容,还会主动判断用户需要什么样的呈现方式,甚至直接在回答中生成可以操作的交互工具。用户既不需要学习新的操作方式,也不需要专门提出“帮我生成界面”的要求。
听起来似乎只是回答形式变得更丰富了,但从实际体验来看,Intelligent UI 真正有意思的地方,在于交互本身。
AI 教我打麻将?ChatGPT 直接摆出了一副牌
“教我广东麻将。”我给 ChatGPT 提了一个非常简单的要求。
麻将的基本规则并不难找,但把“四组牌加一个对子”背下来,和面对一手牌知道该打哪张,完全是两码事。如果只靠文字讲规则,用户得一边读、一边在脑子里把牌摆出来,再想象摸牌和出牌之后会发生什么。
ChatGPT 先说明采用广东推倒胡作为教学版本,再分别配图介绍万子、筒子、条子和字牌。讲到胡牌规则的时候,它直接给出了关键公式:4 组牌 + 1 个对子 = 胡牌,并用 1 万 2 万 3 万、4 筒 5 筒 6 筒、7 条 8 条 9 条、东东东加上 5 万 5 万,凑成了一副完整的 14 张示例。

(截图来源:ChatGPT)
到了练习环节,页面中出现了一块手牌区域,十四个小格代表十四张牌,下方则是出牌选项和“确认出牌,继续练习”按钮。没有洗牌动画,牌面也主要以“1 万”“2 筒”这样的文字呈现,但牌与牌之间有了位置和分组,规则立刻就有了可以对照的对象。我可以先看哪些牌已经连成顺子,再观察剩下的东风和西风,最后决定该打出哪一张。

(截图来源:ChatGPT)
第一轮我选择打出东风。ChatGPT 在肯定这一步的同时,也指出打西风同样成立,并把留下西风后怎样组成对子展示出来。随后它又给我摸进一张六筒,用金色边框标出新牌,让我决定是继续听西风,还是改听六筒。
公允地说,这种边讲边练、即时反馈的方式,比一口气把规则、打法和概率全部讲完要容易跟上得多。前面刚学到的东西,下一步就有机会拿来用,而我的选择又成为后续讲解的依据。

(截图来源:ChatGPT)
当然,以前的 ChatGPT 也能出选择题、模拟牌局。区别在于,现在选项成了可以点击的控件,手牌也始终摆在眼前。我需要关心的仅仅是这一步怎么打,不必每次都把牌面和选择重新描述一遍。
到了后面,当筒子连成二三四五六筒时,我选择打六筒,并要求它详细解释几种打法。ChatGPT 会把不同选择列成表格,再把留下二三四五筒后,摸到二筒和五筒各自怎样成牌拆开显示。最后假设未知牌还有 60 张,它还用柱状图比较了不同选择下一摸就自摸胡牌的概率。

(截图来源:ChatGPT)
表格适合逐项查参数,牌组适合看组合关系,图表适合看差距。三种呈现方式各司其职,文字就不用再去描述所有关系。更重要的是自由的提问节奏:选项让我容易接着往下学,聊天框又允许我随时插进一个新问题、扭转接下来的内容方向。对于这种边学边产生疑问的任务,GPT-6 基于智能界面的对话就显得尤为自然——也几乎可以想象,这对于更多类型的学习任务会有多实用。
更直观的回答,也更容易被理解
当然,不只是学习型对话,Intelligent UI 也在很大程度上改变了 ChatGPT 的对话体验。过去让 AI 介绍一款产品或一件事,基本都只能得到一段或长或短的文字。但在 GPT-6 里,我让它帮我全面了解一款设备,ChatGPT 给出的仍然是一篇很长的回答,不同的信息却拥有了不同的呈现方式:产品外观用图片、规格用卡片、产品间对比用表格、解释计算架构时则直接画出关系图。
规格卡片的好处非常直观。价格、处理器、内存、屏幕等信息各自有固定位置,大号数字下面配着说明,扫一眼就能定位到自己关心的项目。它保留了正文的阅读顺序,同时也提供了一种快速浏览关键信息的阅读方式。

(截图来源:ChatGPT)
更有用的是架构图。在解释 RTX Spark 的 CPU、GPU 与内存关系时,ChatGPT 把不同的计算架构画成方框与连线,直观展示独立显存与统一内存池之间的差异。后面讨论硬件、本地与云端计算、Agent 执行环境的关系时,又换成了分层图与流程图。

(截图来源:ChatGPT)
当我继续追问微软到底想通过这类设备重新定义什么样的个人电脑时,GPT-6 不仅给出了一种观点,还用四层关系结构图概括了新一代 AI PC 的形态,并通过流程图直观展示了微软 Hybrid Intelligence 概念下的工作流——从用户下达任务,到 Agent 规划拆分,再分流到本地执行与云端执行,最后整合交付成果。需要注意的是,这张图是基于任务特性的示例,并不代表 Windows 已经自动完成了所有步骤或实现了这一特定路由策略。

(截图来源:ChatGPT)
这类信息用文字当然也能讲清楚,但阅读门槛和记忆成本很高——读者得先把前面几个概念记住,再在脑子里连起来。图的作用是把关系直接放在眼前,后面的文字则可以继续解释每一层解决什么问题、存在哪些限制。尤其在一篇很长的回答里,这些图也成了阅读时的参照点:读到后面忘了某个概念的位置,可以回到图上确认,不必翻回去重读前面的内容。
不过,图文排版只是阅读体验的一部分。当我询问纸飞机怎么折才能飞得最远时,GPT-6 会调用 GPT Images 2.5 生成步骤图;进一步追问原理,它还能用图画、公式和细节展示等手段配合讲解。比如分析纸飞机的受力情况时,它会画出升力、重力、阻力和速度方向的示意,并在稳定滑翔的近似条件下给出公式:
$L = \frac{1}{2}\rho V^2 S C_L$
$D = \frac{1}{2}\rho V^2 S C_D$

(截图来源:ChatGPT)
这既是对大模型能力更充分的利用,也是对用户更好的信息展现。
更值得注意的是,OpenAI 并没有让 AI“完全自由生成”界面,而是为 AI 准备了一套比较统一的界面基础。按照官方介绍,Intelligent UI 使用原生组件库,并由编译器在模型生成内容的过程中逐步呈现界面。模型接受的训练也包括如何组织内容、安排布局,以及什么时候应该增加交互、什么时候文字已经足够。
这与 Google 公开研究中直接生成 HTML、CSS 和 JavaScript 来构建定制页面的方式,呈现出完全不同的工程侧重。自由编写页面拥有更大的设计空间,但使用统一组件则更容易保留用户熟悉的按钮、表单和阅读习惯。从目前来看,Intelligent UI 的做法其实更值得借鉴。
Intelligent UI,会成为新的 AI 交互标准吗?
去年,Google 在 Gemini 3.0 中展示了生成式界面(Generative UI)的探索:面对不同提问,Gemini 不再局限于文字和图片,可以直接生成带有交互功能的网页,甚至让用户通过操作界面来理解知识、解决问题。
国内的蚂蚁灵光也走得相当激进。用户只需要用自然语言提出需求,灵光就能生成各种可交互的小工具,从旅行规划、数据计算到小游戏,不需要用户懂得编程,也不用再去寻找专门的 App。
这些探索都指向同一个方向:既然 AI 已经能够理解用户意图,为什么还要让用户适应预先设计好的软件界面,而不是让 AI 根据需求直接生成界面?但生成一个能用的小工具,与让用户在日常对话中稳定、自然地使用这些工具,其实是两回事。尤其对于 ChatGPT、Gemini 这样覆盖大量不同任务的通用 AI 助手来说,用户未必每次都需要一套全新的界面,更不希望每次提问都要重新理解一套操作逻辑。
这也是我认为 Intelligent UI 更值得借鉴的原因。

(图片来源:OpenAI)
OpenAI 没有一味追求界面生成的自由度,而是先建立一套统一的组件和交互规则,再让 GPT-6 决定什么时候使用、如何组合。它仍然可以根据需求生成专门的交互内容,但更多时候,只需要在原本的回答中加入一张图、一组卡片,或者几个可以点击的选项。看起来没有直接生成一个完整网页那么惊艳,却更符合用户日常使用 AI 的方式。
回到前面的麻将教学:我并不需要 ChatGPT 为我开发一款麻将游戏,只需要它在讲规则时摆出手牌、在练习时提供出牌按钮、在比较不同打法时展示概率图。了解一款产品也是一样,没有必要生成一个完整的产品网站,只要把图片、参数和架构图放在合适的位置,就已经能显著改善阅读体验。好的界面不在于生成了多少东西,而在于有没有减少用户理解和操作的成本。
更重要的是,这种方式也更容易融入今天的 AI 产品。尤其当 AI Agent 越来越多地代替用户执行任务时,并不意味着用户就不需要参与了。恰恰相反——当 AI 开始帮我们搜索信息、比较方案,甚至操作其他软件时,用户仍然需要了解它做了什么、为什么这样做,以及如何调整和确认下一步。一套可以根据任务变化的交互界面,显然比让 AI 单纯输出文字回答更有用。

(图片来源:OpenAI)
当然,Intelligent UI 目前还远没有解决所有问题。动态生成的交互能否长期保持稳定,需要更多实际使用来验证,更不用说它距离真正替代复杂的软件应用,还有很长一段路。但至少,ChatGPT 确实在摆脱过去那种“无论问什么,主要都靠文字回答”的惯性。当 UI 组件成为模型输出的自然一部分,人与 AI 的协作方式也会随之改变——这可能才是 OpenAI 这次更新最值得持续观察的地方。在云栈社区,关于 AI 产品的交互设计同样是开发者们长期关注和讨论的话题之一。