一个聊天,在哪里占优,在哪里不占优
对一次性的文字工作来说——改写、翻译、总结、起草、解释——一个单一的聊天,胜过一整排专门的工具。当同样的操作要重复数百次时,当输出必须能精确复现时,或者当这项工作必须在无人看管的情况下运行时,它就会输给一个专用工具。
把聊天当作一个万能工具来推销,说对了一半,而有用的那一半,是有边界的。说清楚这条边界,能省去用它去做一件它在结构上就做不了的工作时的那种失望。
延伸阅读
它占优的地方:一次性的文字工作
任何你会亲手在一页文字上做一次的事。一个专用工具的搭建成本,超过了整个任务本身,而聊天没有搭建成本。这涵盖了普通一天里的大部分内容,这也是为什么这个推销词感觉是对的。
它落下风的地方:大量重复
对500个条目做同样的操作,需要的是一个脚本,而不是一次对话。按设计,一个聊天每次给出的结果都略有不同,而审查500个略有不同的结果,比写这个脚本更糟糕。这个临界点,比人们预期的更低,大约在20个条目左右。
它落下风的地方:保证
当输出对相同的输入必须完全一致,或者必须可证明是正确的时,生成出来的文字,就是错误的形式。一个计算器、一个验证器,或一个数据库,能给出一个保证;一个聊天,给出的是一个看似合理的答案,而这种区别,恰恰在最容易被忽略的地方,才最要紧。
它落下风的地方:无人看管的工作
一个聊天,需要有人去读这个回答。一项必须在凌晨三点运行、而且必须正确的工作,需要的是一个会大声报错、而不是产出一段文字的东西。这是这种形式本身的一条边界,而不是任何特定产品的边界。
使用者常问的问题
那些基于同一个模型搭建的工具呢?
它们加上了缺失的部分:重复、验证、错误处理。模型是一样的;你所缺少的,是围绕它搭建的那个产品。
20个条目,真的是那个临界点吗?
这取决于每个条目需要多少审查。关键在于,这个临界点确实存在,而且比人们的热情所暗示的要低。
一段更长的对话,对处理大量任务有帮助吗?
这只会让情况更糟。这段对话的预算,会被更早的条目占满,随着最早的那些条目移出视野,质量也会下降。
拿一项一次性的文字工作来试试,看看一个聊天能做到什么程度。
打开工具