找回密码
立即注册
搜索
发回帖 发新帖

4935

积分

0

好友

623

主题
发表于 1 小时前 | 查看: 5| 回复: 0

我在 Codex 越来越拉了 一文中说过,OpenAI 最近每天都在搞新闻,但模型不如 A 社、速度偏慢、token 消耗过快,这些问题都还悬着。

Tibo 搞了个“28 天不更新就重置”计划,不过他好像一直没搞懂大家真正想要什么。

Tibo 10月7日 Day 2 更新总结与投票截图

但这次不太一样:刚刚更新的 GPT-6 边思考边回答和 Intelligent UI(智能交互界面),大家还是很买账的。

GPT-6 核心架构:Intelligent UI 与交叉推理流水线

这次 GPT-6 的边思考边回答,直接重构了原来那种“先憋完再输出”的单向链路。它把深度思考和答案组装做成了交叉流式协同:

模型一边继续深挖后续推理分支,一边把已经确认的阶段性结论、背景铺垫和核心要素先组织输出给用户。

7速自行车设计的智能交互界面示例

以往生成复杂界面需要等整个 HTML/JS 代码写完才能渲染;现在是模型一边推理,模型一边推理,组件编译器一边在前端同步流式解析构建,按钮、卡片、滑块像搭积木一样实时长出来,响应几乎零卡顿。

GPT-5.6 Instant 与 GPT-6 Instant 对周日烤羊午餐计划的对比

我实测了几个例子,发现它并非每次都会触发:用 GPT-6 更容易触发,在工作模式下更容易触发,GPT-5.6 + Codex 模式则很难触发。

比如这个旅行打包助手,触发 Intelligent UI 后长这样:

ChatGPT Work 旅行打包助手交互界面

同样的提示词,如果没有触发 Intelligent UI,就只会拿到这样一个写死的 HTML 文件:

Travel Wardrobe 旅行衣橱规划网页

提示词: 请用“每天买咖啡、面包和牛奶”这个生活场景,向一个没有经济学基础的人解释通货膨胀。我不想只看定义,想亲手改几个价格,看看一篮子东西的成本会怎么变。

请做一个可交互的简化购物篮。基期设定为:咖啡每杯 10 元、购买 10 杯;面包每个 5 元、购买 20 个;牛奶每盒 8 元、购买 10 盒。以上都是虚构教学数据。固定购买数量,让我分别调整三种商品的当期价格,并同步显示基期成本、当期成本、以基期为 100 的价格指数和涨幅。用图表展示各商品对成本变化的贡献,并明确这只是教学模型,不等于真实 CPI 的完整统计方法。

通货膨胀与CPI交互教学模拟

提示词: 周六晚上 6 点半,朋友来我家吃饭,目前 6 个人,可能增加到 10 人。厨房只有两个灶和一个电饭煲,没有烤箱。帮我安排一顿准备难度适中的中式家宴,尽量避免客人到了我还一直在厨房忙。

请把方案做成可以操作的家宴计划:能调整人数和开饭时间,查看菜品卡片、对应食材用量、采购清单和做饭时间轴。人数改变时,采购量要同步更新;开饭时间改变时,关键准备节点要一起调整。备菜步骤可以勾选完成。注意两个灶的使用冲突,不要把烹饪时间简单按照人数成倍放大。

ChatGPT Work 家宴菜单规划

ChatGPT Work 家宴做饭时间轴甘特图

提示词: 给我一个可以直接在聊天里玩的复古像素小游戏:小猫在画面底部左右移动,接住掉下来的鱼,同时躲开掉下来的靴子。画面简单一点,但我要能马上开始玩。

规则是接到一条鱼加 10 分,碰到一只靴子减少一条生命,初始有 3 条生命,每局 60 秒,时间结束或生命耗尽时结算。提供开始、暂停、继续和重新开始按钮,支持键盘左右方向键,也提供屏幕上的左右移动按钮。分数、生命和倒计时要实时更新。只做一个完整的小回合,不要扩展登录、排行榜或后端,也不要只给游戏截图、规则说明或代码。

复古像素接鱼小游戏

提示词: 我刚开始学摄影,想拍夜晚走动的人,但总分不清快门、光圈和 ISO 分别影响什么。请用一个能调整参数的演示教我,不要一上来就给一堆公式。

请设置一个固定的教学场景,里面有移动的人物、近处物体和远处背景。提供快门、光圈和 ISO 三组可调整控件,调整时,场景示意和简短解释同步展示亮度、运动模糊、背景虚化和噪点的变化方向。能恢复默认参数,也能并排比较调整前后。明确这是教学近似,不要把它包装成某款相机的真实成像或实测结果。

摄影快门光圈ISO教学模拟

提示词: 我总把两件事混在一起:“硬币抛得足够多,正面比例会接近一半”,以及“已经连续出了好多次正面,下一次应该轮到反面了”。请用一个可以亲手操作的抛硬币实验,帮我理解这两种想法有什么区别。

抛硬币实验:可以一次增加 1 次、10 次、100 次或 1000 次投掷,显示累计投掷次数、正反面数量,以及正面比例随次数变化的折线图。默认正面概率是 0.5,也能调整成偏置硬币,并显示相应的概率参考线。能重置实验。结果必须来自随机抽样,不能预先写死一条越来越平滑的曲线。

抛硬币概率与大数定律交互模拟

提示词: 帮我规划一个从杭州出发、去德清和安吉的两天一夜亲子自驾路线,两大一小。偏好自然风景、轻松散步和适合孩子停留的地方,不想高强度爬山,每天开车尽量不超过两小时。先做不绑定具体日期的路线草案。

请把路线放到聊天里的可交互地图和每日行程中。点击停靠点能看到停留建议、预计车程和适合去的理由;能在“少开车”和“多看自然”之间切换,并同步调整路线。标明哪些信息是估算。涉及开放时间和票价时,请先核实来源,没核实的不要编造。只做规划,不预订、不付款。

杭州德清安吉亲子自驾路线规划

提示词: 帮我拆解一台台式电脑的内部结构,让完全不懂电脑的人也能看懂:CPU、显卡、内存、SSD、主板、电源和散热风扇分别干什么,它们又是怎样配合工作的?

请直接在聊天里用可交互的结构示意图展示。点击某个部件时,高亮它,并显示简短说明和它与其他部件的连接关系。提供“日常办公”“玩游戏”“运行本地 AI”三个场景,切换后突出各场景主要涉及的部件。结构要清晰准确,不必追求写实 3D,也不要虚构实测功耗、速度或占用率。

台式电脑内部结构交互图解

其实这个功能我在豆包中很早之前就发现了,很多回答里它都倾向于给出可交互图解。我又拿相同提示词试了一下,效果居然不输 ChatGPT。

豆包台式电脑内部结构交互拆解

花里胡哨的功能最能吸引注意力,但我比较看重模型本身能力的提升。大模型世界里,模型能力就是一切,一俊遮百丑。

这次 OpenAI 针对不同用户梯队,对底座模型完成了全套换代更新:

  • GPT-6 Sol:主力旗舰版本,专门配备给 ChatGPT Plus、Pro、Business 以及 Enterprise 企业版订阅用户,拥有满血的思考深度、全套 Intelligent UI 调度能力以及极高的并发处理阈值。
  • GPT-6 Luna:轻量普及版本,全量推送给全球海量的 Free 免费版和 Go 用户,同样支持日常对话与基础智能 UI,日常响应极为轻快敏捷。
  • Codex 与 Work 专区:这次更新暂时仅针对 ChatGPT 对话端,Codex 编程专区和 ChatGPT Work 企业工作流中依然沿用此前 9 月份的版本矩阵,后续会逐步统一步伐。

OpenAI 官方内部评测给出的实测数据:

  • 在高价值的日常复杂 Agent 任务中,GPT-6 Extra High 的首字响应时间直接拉平到了上一代 GPT-5.6 Medium 的极速水平,而最终任务综合完成度得分甚至超越了过去的 GPT-5.6 Extra High。
  • 在需要联网搜索最新信息的复杂场景下,GPT-6 Instant 的平均首字吐出速度,比 GPT-5.6 Instant 还要整整快出 44%。
  • 更关键的是,它大幅减少了无效的搜索抖动,能更精准地抓取支撑论据的关键页面,避免模型在全网胡乱瞎逛浪费 token。

而以前最常见的痛点,是遇到复杂数理逻辑、编程或 Agent 规划任务时,模型在后台疯狂开动思维链,屏幕上一片漆黑或者只转一个思考圈圈,往往一憋就是几十秒甚至一两分钟,用户根本不知道它是不是卡死了,心理压力拉满。

总结

GPT-6 + Intelligent UI 正在把“回答”本身直接变成即用即弃的微型软件。整个 IT 行业和应用生态的生存法则,恐怕要迎来一次大清洗:未来很多传统软件可能完全没有独立存在的必要。

以前软件是开发者写死、打包上架、用户下载安装的静态程序;未来软件的概念会被彻底解构,直接附着在每一次即时自然语言交互之中,需要时动态生长,用完即刻消散。

大模型厂商的超级 App 会像黑洞一样,把海量的碎片化需求全部吸入对话框。这种产品形态上的变化,也值得在 云栈社区 持续观察和讨论。




上一篇:美国终于认真搞开放模型:Beam 501B MoE 能否撼动国产开源?
下一篇:Claude Code 做 Agent 算力调度:Haiku 5.5 低至 $0.10,瞄准国产 Flash
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-9 04:12 , Processed in 0.067865 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表