造东西的时候,对话是最好的方式。用东西的时候,对话是最差的方式。
起因是个很小的事。前阵子刷到一个说法,一下就记住了:对话是 AI 的 Demo,不是它的终局。
这句话琢磨了好几天。越想越觉得,它戳中的是一件我们所有人都默认了、却从来没认真想过的事。
01 我们默认的那个未来
先说那个默认。
现在打开任何一个 AI 产品,界面长得都差不多:下面一个输入框,上面一串气泡。
Meta 的 Muse,在云端替你开浏览器收发邮件、管日历、付款下单。OpenAI 的 Dots,连了四千多个 App 替你办事。还有一堆数不过来的新产品。
它们画的未来是同一个:一个对话框,你说话,它干活。
听起来很顺,对吧?我也觉得顺。
但你往细里想一步:
追问一:那你想选哪个
十个选项摆在面前,你要挑一个。用嘴说是什么体验?「我要第三个……不对,是那个,就那个蓝的旁边那个。」鼠标点一下的事,嘴要说半分钟。
追问二:那你想看一眼数字
你每天早上要看一个数。对话式怎么做?每天问一遍「今天我那个数是多少」。你真正想要的是它自己显示在那儿,不是每天问一次。
追问三:那你想重复用
重复的事,你不想每天重新描述一遍。这才是最要命的。
这三个问题指向同一件事:人机交互这件事,一直在往"离开纯文字"的方向走。命令行,到图形界面,再到触屏,每一次进步都是在离文字更远一点。
所以一个只能靠对话的 Agent,往根上说,就是——一个更聪明的命令行。
02 两个家庭,两个 App
空讲道理没意思。讲两个亲眼看到的真事。
第一个家庭,有个一岁半的孩子,还不太会说话。
家里大人用 Eazo 给他做了个学说话的 App:几张大卡片,点一下就出声,认数字、认字母、认动物、认生活用品。
妙在哪:用的人不需要会打字
一个一岁半的孩子,不会打字,也说不清楚指令。任何"只能靠对话"的 Agent,对这孩子来说根本不存在。几张会说话的卡片,刚刚好。
第二个家庭请了睡眠顾问。顾问给的方案是一份写满条件判断的 PDF:孩子清醒多久该睡、小睡最长多久、小睡失败以后怎么办。
孩子他爸 Adam Waxman 花了七个晚上,把它做成了一个 App。之后他、他妻子、保姆三个人共用同一份实时作息表。小睡短了,作息自己会重排。
孩子现在能睡整觉了。
这个 App 用了大概四个月就退役了。他不心疼,因为只花了一周。有些工具,就是为了那几个月而生的。
把这两件事放一起看,会发现同一个东西:
共同点一:应用商店里找不到
这两个 App,商店里翻烂了也找不到。也没有哪家公司值得为它专门立个项。它们只对这一家人有意义。而这,恰好就是它们的价值。
共同点二:做的人用对话,用的人只点点
做的时候是聊天聊出来的,用的时候是伸手点一下。
共同点三:可以只为一段时间存在
不追求永远在用。需要的时候有,不需要了就退场。

03 造和用,是两件事
琢磨出来的那个判断,其实就是上面这些事的一句话总结:
对话,是用来造东西的。界面,是用来用东西的。
这两件事,现在被太多产品硬捏成了一件事。
打个比方,你一听就懂。
卧室里的灯。你只要跟电工说一次「开关装床头」,之后每个晚上伸手一按就完了。你不会每天晚上对着空气喊一句「关灯」。
但现在很多 Agent 让你干的就是这件事:每晚喊一声。
喊一次叫新鲜,喊一百次叫折磨。
现在的路子:替你去操作别人的 App
你说「帮我订张票」,它去驱动别人的软件。干得再漂亮,那个 App 也不是你的。
该有的路子:为你造一个你的 App
你把需求说一次,它给你造一个看得见、点得动、还能分享的东西。之后每天点一下就行。这个 App 是你的。
说到这儿就很清楚了:对话负责"理解你要什么",界面负责"让你天天用"。一个管造,一个管用,分工不能混。
04 那就得有个新定义
顺着这个思路往下推,Personal Agent 这个东西,可能得重新定义一下。
现在大家说 Personal Agent,说的是"一个替你干活的助手"。
但按上面那套逻辑,真正的 Personal Agent 应该长成另一个样子:
它有稳定的一面:你回得去
今天做的 App,明天打开还是它。不是每次问都重新生成一遍,那玩意儿你记不住,也信不过。
它有设计:不是一坨临时拼的
它得是个能学会、能信任的界面,不是每次给你一个长得都不一样的半成品。
它背后有 AI 在干活:但你不直接跟 AI 说话
AI 在界面的后头工作,你在前头点点。
已经看到有产品在按这个定义做。Eazo 就是其中一个,上面那两个家庭的故事都是它官网上的真实案例。
它干的事说白了就一句:你用自然语言把需求说一遍,它把它变成一个看得见、点得动、能分享的作品。之后你每天只需要点一点。

它上面有个设计挺对路子,叫 Wild Design:你抛一个模糊的需求过去,它先给你出六种以上风格完全不同的视觉方案,你挑一个再往下走。
这一步挺关键。大多数人说不清自己要什么,但看得清自己不要什么。给你六个摆在面前选,比让你写一段精确的需求描述,容易太多了。
05 那对话框就没用了吗
得把话说圆了,不然容易被误解。
不是说对话没用。对话恰恰是表达新需求最好的方式。
你要造一个新东西,说比画快。这一点对话无可替代。
问题在于:造完之后呢?
造的时候,对话是主角;用的时候,界面是主角。
混在一起的后果,就是你每天对着一个对话框,重复描述你早就说清楚过的事。
换个角度想这件事:App 这个东西不会消失。会变的只有一件事:
App 不再只由少数公司造给所有人,而是每个人都能给自己造。
以前你要一个顺手的工具,只能去应用商店里翻,翻到就用,翻不到就忍。
以后不一样了。你缺什么,说一句,它给你造一个。造出来的东西只对你有用,别人用不上,但没关系——它本来就不是给别人用的。
06 也得说点实在的
夸了这么多,得泼点冷水。这条路不是没毛病。
第一个问题:生成的界面会丑
你自己造的东西,审美全靠你自己。同一个需求让 AI 出六版,可能六版你都觉得"能用但不好看"。
第二个问题:它会不会太慢
每次都要生成,每个界面都要现造。如果每次打开都要等它想几秒,那这套东西的体验会当场崩掉。
第三个问题:稳定性和灵活性的矛盾
要它每次都稳定,就得限制它能变的花样;要它灵活,稳定就没了。这个平衡很难找。
这三条不是瞎担心。现在那些"两分钟生成一个 App"的演示,几乎都不谈输出稳定性。而稳定,恰恰是能天天用的前提。

不过话说回来,方向我觉得是对的。
收个尾
判断一个技术方向,有个很土的标准:
看它是在解决"看得见的热闹",还是在解决"说不出的别扭"。
热闹的东西容易火,也容易散。别扭的东西一旦被解开了,就再也回不去了。
「对话框是 AI 的终局」这个说法,热闹了两年了。
但真拿去用一个月,就会碰上那个说不出的别扭:你明明只是想让某个东西一直在那儿,但你每天得求它一遍。
我赌后面这件事会被解决。而且解决它的方式,不是让对话框更聪明,是——给它配一张脸。