不是所有事情都值得让大模型想一想
过去两年,整个AI行业陷入了一场集体幻觉,仿佛所有任务都应该交给大模型去完成。
写代码、做PPT、查资料、订机票、回邮件、分析数据......默认路径永远是打开一个对框,输入指令,等一个结果回来。
而Jev的出现,第一次让这场幻觉出现了巨大的裂缝。
它的核心限制乍看很奇葩,不生成任何自然语言,只输出结构化的判断。比如你问它“这封邮件是否紧急”,它只回答是或否,同时告诉你它有多确定。你问它“这笔交易该不该执行”,它只回答该或不该,同时附上成功概率。
这个限制之所以重要,是因为它强迫我们重新问一个问,这件事真的需要大模型吗?
过去所有AI产品默认的答案是“需要”,但在我们交给它的任务里并非所有都需要生成一大段文字,真正要的只是一个判断而已。Jev想做的事情就是把这个浪费砍掉,由此换来的是速度比大模型快20-200倍,成本低40-400倍。
为什么过去我们会觉得所有任务都该交给大模型?答案不在技术,在交互惯性。ChatGPT的经典界面就是一个对框,你在对框里输入问或指令,它输出结果。这个交互模式太典型,以至于很多人都默认了“AI就是聊天,聊天就是AI”。当你手里只有一把锤子,所有问看起来都像钉子。
但真实世界里的任务主要可以分成两类,一类需要理解和泛化,需要处理模糊的、开放的、没有标准答案的问。比如写一份行业分析,做一个产品方案,构思一个营销创意。这类任务天然适合大模型,因为大模型很擅长处理这种开放性的输入和输出。
另一类只需要判断,输入是结构化的,输出是有限选项的,任务本质是在几个可能性里选一个。比如“这封邮件该分给谁”、“这笔订单风险高不高”、“这个Agent步骤该并行还是串行”,这类任务用大模型来做就像用起重机去拧螺丝,干是能干,但慢、贵且用力过猛了。
过去这类任务是怎么解决的?答案是规则引擎。如果用户点击了A就推荐B,如果订单金额超过某个阈值就标记为风险订单。规则引擎又快又便宜但缺乏泛化能力,一旦遇到没见过的场景就失效了。大模型补上了泛化能力,但引入了速度和成本问。结果就是很多场景被迫二选一,要么用规则引擎精度不够,要么用大模型成本扛不住。
Jev填补的正是中间那个空档,它保留了泛化能力但把输出限制在预设的结构里,所以它才既有大模型的泛化能力,又有规则引擎的速度和成本。我们不应把它视作一个更小的大模型,而是一个新的物种。
它意味着我们该停止问“这个任务能不能用大模型做”,而是先思考“这个任务需要的是理解还是判断”。理解交给大模型,判断交给Jev这样的专用模型。这个分工一旦建立,很多此前在经济上不成立的事情就会跨越鸿沟。
一个Agent工作流可能有几十个步骤,其中大部分只需要“往左还是往右”的判断,却被迫调用一个前沿模型来生成一段JSON再解析出来用。现在这些判断可以交给Jev,用一个HTTP往返就能回答一批问,前沿模型的注意力可以留在真正需要推理的地方。
一个游戏AI每秒需要做出十几次决策,用大模型延迟太高,用规则引擎又太死板,Jev可以在毫秒级完成“这个敌人该进攻还是撤退”的判断。一个推荐系统每天需要处理数十亿次候选筛选,用大模型的成本无法承受。Jev可以把每次筛选的成本压到几乎为零,让推荐系统第一次可以围绕“确定性”来设计逻辑。
这些变化的前提是接受一个反直觉的判断,不是所有事情都值得让大模型想一想。有些判断需要泛化能力,但不需要文字生成。有些任务需要智能,但不需要慢思考。把这些问交给一个更专用、更轻量、更快的模型,才是正确的工程选择。
过去所有人都在讨论大模型能做什么,但我们是否也该好好想想哪些事情其实并不需要大模型?
@aigc1024
过去两年,整个AI行业陷入了一场集体幻觉,仿佛所有任务都应该交给大模型去完成。
写代码、做PPT、查资料、订机票、回邮件、分析数据......默认路径永远是打开一个对框,输入指令,等一个结果回来。
而Jev的出现,第一次让这场幻觉出现了巨大的裂缝。
它的核心限制乍看很奇葩,不生成任何自然语言,只输出结构化的判断。比如你问它“这封邮件是否紧急”,它只回答是或否,同时告诉你它有多确定。你问它“这笔交易该不该执行”,它只回答该或不该,同时附上成功概率。
这个限制之所以重要,是因为它强迫我们重新问一个问,这件事真的需要大模型吗?
过去所有AI产品默认的答案是“需要”,但在我们交给它的任务里并非所有都需要生成一大段文字,真正要的只是一个判断而已。Jev想做的事情就是把这个浪费砍掉,由此换来的是速度比大模型快20-200倍,成本低40-400倍。
为什么过去我们会觉得所有任务都该交给大模型?答案不在技术,在交互惯性。ChatGPT的经典界面就是一个对框,你在对框里输入问或指令,它输出结果。这个交互模式太典型,以至于很多人都默认了“AI就是聊天,聊天就是AI”。当你手里只有一把锤子,所有问看起来都像钉子。
但真实世界里的任务主要可以分成两类,一类需要理解和泛化,需要处理模糊的、开放的、没有标准答案的问。比如写一份行业分析,做一个产品方案,构思一个营销创意。这类任务天然适合大模型,因为大模型很擅长处理这种开放性的输入和输出。
另一类只需要判断,输入是结构化的,输出是有限选项的,任务本质是在几个可能性里选一个。比如“这封邮件该分给谁”、“这笔订单风险高不高”、“这个Agent步骤该并行还是串行”,这类任务用大模型来做就像用起重机去拧螺丝,干是能干,但慢、贵且用力过猛了。
过去这类任务是怎么解决的?答案是规则引擎。如果用户点击了A就推荐B,如果订单金额超过某个阈值就标记为风险订单。规则引擎又快又便宜但缺乏泛化能力,一旦遇到没见过的场景就失效了。大模型补上了泛化能力,但引入了速度和成本问。结果就是很多场景被迫二选一,要么用规则引擎精度不够,要么用大模型成本扛不住。
Jev填补的正是中间那个空档,它保留了泛化能力但把输出限制在预设的结构里,所以它才既有大模型的泛化能力,又有规则引擎的速度和成本。我们不应把它视作一个更小的大模型,而是一个新的物种。
它意味着我们该停止问“这个任务能不能用大模型做”,而是先思考“这个任务需要的是理解还是判断”。理解交给大模型,判断交给Jev这样的专用模型。这个分工一旦建立,很多此前在经济上不成立的事情就会跨越鸿沟。
一个Agent工作流可能有几十个步骤,其中大部分只需要“往左还是往右”的判断,却被迫调用一个前沿模型来生成一段JSON再解析出来用。现在这些判断可以交给Jev,用一个HTTP往返就能回答一批问,前沿模型的注意力可以留在真正需要推理的地方。
一个游戏AI每秒需要做出十几次决策,用大模型延迟太高,用规则引擎又太死板,Jev可以在毫秒级完成“这个敌人该进攻还是撤退”的判断。一个推荐系统每天需要处理数十亿次候选筛选,用大模型的成本无法承受。Jev可以把每次筛选的成本压到几乎为零,让推荐系统第一次可以围绕“确定性”来设计逻辑。
这些变化的前提是接受一个反直觉的判断,不是所有事情都值得让大模型想一想。有些判断需要泛化能力,但不需要文字生成。有些任务需要智能,但不需要慢思考。把这些问交给一个更专用、更轻量、更快的模型,才是正确的工程选择。
过去所有人都在讨论大模型能做什么,但我们是否也该好好想想哪些事情其实并不需要大模型?
@aigc1024