关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
挺有意思,我觉得这种思维方式就挺好的。
6、提升 AI 算力,不只有继续买 GPU 这一条路,短期内更大的机会可能来自软件优化。毕竟买 GPU 增加的是原始算力,而通过软件优化,则可以把已有算力用得更充分。哈哈哈,这不就是国内公司重点在做的事情嘛。
通过改进算法和计算方式,减少无效计算和资源闲置,同样数量的芯片、同样多的电力,可以生成更多 Token,完成更多任务。
简单来说,过去需要十张卡完成的工作,经过优化后,未来可能只需要更少的卡。对缺少顶级芯片的公司来说,软件效率本身就是一种算力。
7、面对 Kimi 和越来越多便宜且智能水准不错的开源模型,Sam 的观点是,世界上一定会出现很多优秀、便宜的模型,也一定会有人因为私有部署、修改权重和数据安全选择开源。
而 OpenAI 的目标是覆盖从高智能到低价格的整条曲线,在不同速度、价格和能力要求下,都提供有竞争力的模型。
8、其他公司可以蒸馏前沿模型,再用更低的价格提供服务,但 Sam 并不认为这会动摇 OpenAI 的商业模式。
因为训练模型和调用模型,是两笔不同的账。训练下一代前沿模型,需要一次性投入巨额资金。模型发布之后,每一次 API 调用和 Agent 执行任务,都会持续带来推理收入。
Sam 判断,未来人们会把大量工作交给 AI,整个推理市场可能大到难以想象。即使每次调用赚得不多,只要调用量足够大,累计利润依然可以覆盖下一代模型的训练成本。
OpenAI 真正押注的不是高价和高毛利,而是智能使用量会持续爆发。
9、今天的模型已经非常接近 AGI,但还缺少几项关键能力。
第一,面对一个极其复杂的任务,比如治愈某种癌症,它还不能自己拆解问、设计实验、推进研究,最后交付结果。
第二,它还很难进入物理世界,独立控制机器人完成复杂操作。第三,它缺少持续学习能力,完成任务之后获得的经验,并不会立刻沉淀成新的能力。
简单来说,现在的模型已经很会思考和解决局部问,但还不能长期自主行动,也不能一边工作一边成长。完整 AGI,应该能够理解目标、持续行动、从结果中学习,最终独立完成一整件复杂的事情。
10、AI 发展的瓶颈一直在变化。早期真正稀缺的是研究思路,团队还不知道怎样训练出更聪明的模型,给再多算力也没有用。
技术路线逐渐明确后,有了大量值得验证的想法,算力开始成为决定性因素。
后来公开数据接近用完,数据又成了新的限制。现在数据问已经通过合成数据、强化学习等方法得到缓解,最近半年新的研究思路也明显增多,于是瓶颈再次回到算力。
因为每一个新想法都需要大量实验验证,算力越多,团队试错越快,下一代模型也越早出现......
11、Sam 已经修正了自己对 AI 失业的判断。2019 年的他如果提前看到今天的模型,大概会认为大量工作已经消失,全球经济也会发生剧烈变化。但现实远没有这么快。
原因是模型的能力非常不均匀,它可以在写代码、分析资料等任务上超过大多数人,却可能在常识判断、长期执行和处理复杂现实环境时频繁出错。
一个岗位通常包含很多不同任务,AI 即使能做好其中一部分,也很难直接接管整份工作。
更常见的情况是,人把适合 AI 的环节交给模型,自己继续负责判断、协调、承担责任和处理意外。
AI 对工作的影响会先表现为任务被重新分配,再逐渐推动岗位发生变化,很少会在一夜之间让整个职业消失。
就像去年很多人说程序员这职业完了。结果现在看,程序员没消失,只是工作方式发生了巨变:不再是传统意义上的手写代码,而是更像 orchestrator + 产品/系统设计师。
12、Sam 从 ChatGPT 的诞生中得到的产品经验,是观察用户在一个并不好用的工具里,仍然坚持做什么。如果一件事情操作很麻烦,用户还愿意反复尝试,通常说明背后存在非常强的需求。ChatGPT 最初只是一次研究预览,团队并没有预料到它会成为一个现象级产品。
13、Codex 能领先,主要还是因为模型和产品本身做得更好,ChatGPT 带来的分发优势其实很小。
智能本身最终会越来越像一种可以自由购买和替换的标准化商品。
真正能够长期积累的优势,来自 1)大规模、低成本的算力,2)算力、模型和产品之间的协同效率,3)复杂工作流、团队协作、集成生态,4)品牌偏好和长期信任。
简单来说,模型领先很重要,但很难永久领先。真正的护城河,是一家公司能否用更低的成本持续获得智能,再把这些智能嵌入用户很难迁走的产品和工作流程里。
14、现有电脑并不适合真正的 AI Agent。键盘、鼠标和显示器这套形态已经延续了大约五十年,它适合人主动操作软件,但真正的 Agent 却需要长期理解用户的处境,知道用户正在和谁交流、看过什么资料、讨论过什么问,在合适的时机主动提供帮助。
OpenAI 折腾新硬件的主要动机之一,就是为 AI 设计一套原生载体,让它能够持续感知环境、理解上下文并主动工作。
15、即使超级智能突然出现,世界也未必会在第二个月立刻发生巨变。模型能力可以快速突破,但企业流程、基础设施、法律制度和人的习惯仍然需要时间调整。技术发展是一条持续加速的曲线,每个十年都比前一个十年变化更大,但生活在其中的人会很快适应。
16、其实现在,随着 AI 的成熟,最可怕的问是 AI 会不会让人的认知能力逐渐退化。AI 可以帮我们查资料、写代码、分析问,甚至直接给出结论。
效率确实提高了,但人也可能因此不断跳过理解、推理和验证的过程。时间久了,我们也许还能完成工作,却越来越说不清结果为什么成立,系统出了问也不知道该从哪里判断。
这一点我也深有感受。其实就像计算机出现之后,我是觉得人类的记忆力是有衰退的。举个例子,比如导航的存在会让很多人不认路了。
随着越来越多思考被交给 AI,真正需要保留的,是对事物的基本理解、独立判断和形成观点的能力。否则,人类外包出去的不只是工作量,还可能包括自己的判断力、品味和世界观。
但这部分也是一个社会问。因为人毕竟会本能地选择更省力的方式。一旦 AI 可以更快、更便宜地给出答案,大多数人很难长期坚持自己查资料、推理和验证。只靠个人自律,恐怕解决不了认知退化的问。
@aigc1024
6、提升 AI 算力,不只有继续买 GPU 这一条路,短期内更大的机会可能来自软件优化。毕竟买 GPU 增加的是原始算力,而通过软件优化,则可以把已有算力用得更充分。哈哈哈,这不就是国内公司重点在做的事情嘛。
通过改进算法和计算方式,减少无效计算和资源闲置,同样数量的芯片、同样多的电力,可以生成更多 Token,完成更多任务。
简单来说,过去需要十张卡完成的工作,经过优化后,未来可能只需要更少的卡。对缺少顶级芯片的公司来说,软件效率本身就是一种算力。
7、面对 Kimi 和越来越多便宜且智能水准不错的开源模型,Sam 的观点是,世界上一定会出现很多优秀、便宜的模型,也一定会有人因为私有部署、修改权重和数据安全选择开源。
而 OpenAI 的目标是覆盖从高智能到低价格的整条曲线,在不同速度、价格和能力要求下,都提供有竞争力的模型。
8、其他公司可以蒸馏前沿模型,再用更低的价格提供服务,但 Sam 并不认为这会动摇 OpenAI 的商业模式。
因为训练模型和调用模型,是两笔不同的账。训练下一代前沿模型,需要一次性投入巨额资金。模型发布之后,每一次 API 调用和 Agent 执行任务,都会持续带来推理收入。
Sam 判断,未来人们会把大量工作交给 AI,整个推理市场可能大到难以想象。即使每次调用赚得不多,只要调用量足够大,累计利润依然可以覆盖下一代模型的训练成本。
OpenAI 真正押注的不是高价和高毛利,而是智能使用量会持续爆发。
9、今天的模型已经非常接近 AGI,但还缺少几项关键能力。
第一,面对一个极其复杂的任务,比如治愈某种癌症,它还不能自己拆解问、设计实验、推进研究,最后交付结果。
第二,它还很难进入物理世界,独立控制机器人完成复杂操作。第三,它缺少持续学习能力,完成任务之后获得的经验,并不会立刻沉淀成新的能力。
简单来说,现在的模型已经很会思考和解决局部问,但还不能长期自主行动,也不能一边工作一边成长。完整 AGI,应该能够理解目标、持续行动、从结果中学习,最终独立完成一整件复杂的事情。
10、AI 发展的瓶颈一直在变化。早期真正稀缺的是研究思路,团队还不知道怎样训练出更聪明的模型,给再多算力也没有用。
技术路线逐渐明确后,有了大量值得验证的想法,算力开始成为决定性因素。
后来公开数据接近用完,数据又成了新的限制。现在数据问已经通过合成数据、强化学习等方法得到缓解,最近半年新的研究思路也明显增多,于是瓶颈再次回到算力。
因为每一个新想法都需要大量实验验证,算力越多,团队试错越快,下一代模型也越早出现......
11、Sam 已经修正了自己对 AI 失业的判断。2019 年的他如果提前看到今天的模型,大概会认为大量工作已经消失,全球经济也会发生剧烈变化。但现实远没有这么快。
原因是模型的能力非常不均匀,它可以在写代码、分析资料等任务上超过大多数人,却可能在常识判断、长期执行和处理复杂现实环境时频繁出错。
一个岗位通常包含很多不同任务,AI 即使能做好其中一部分,也很难直接接管整份工作。
更常见的情况是,人把适合 AI 的环节交给模型,自己继续负责判断、协调、承担责任和处理意外。
AI 对工作的影响会先表现为任务被重新分配,再逐渐推动岗位发生变化,很少会在一夜之间让整个职业消失。
就像去年很多人说程序员这职业完了。结果现在看,程序员没消失,只是工作方式发生了巨变:不再是传统意义上的手写代码,而是更像 orchestrator + 产品/系统设计师。
12、Sam 从 ChatGPT 的诞生中得到的产品经验,是观察用户在一个并不好用的工具里,仍然坚持做什么。如果一件事情操作很麻烦,用户还愿意反复尝试,通常说明背后存在非常强的需求。ChatGPT 最初只是一次研究预览,团队并没有预料到它会成为一个现象级产品。
13、Codex 能领先,主要还是因为模型和产品本身做得更好,ChatGPT 带来的分发优势其实很小。
智能本身最终会越来越像一种可以自由购买和替换的标准化商品。
真正能够长期积累的优势,来自 1)大规模、低成本的算力,2)算力、模型和产品之间的协同效率,3)复杂工作流、团队协作、集成生态,4)品牌偏好和长期信任。
简单来说,模型领先很重要,但很难永久领先。真正的护城河,是一家公司能否用更低的成本持续获得智能,再把这些智能嵌入用户很难迁走的产品和工作流程里。
14、现有电脑并不适合真正的 AI Agent。键盘、鼠标和显示器这套形态已经延续了大约五十年,它适合人主动操作软件,但真正的 Agent 却需要长期理解用户的处境,知道用户正在和谁交流、看过什么资料、讨论过什么问,在合适的时机主动提供帮助。
OpenAI 折腾新硬件的主要动机之一,就是为 AI 设计一套原生载体,让它能够持续感知环境、理解上下文并主动工作。
15、即使超级智能突然出现,世界也未必会在第二个月立刻发生巨变。模型能力可以快速突破,但企业流程、基础设施、法律制度和人的习惯仍然需要时间调整。技术发展是一条持续加速的曲线,每个十年都比前一个十年变化更大,但生活在其中的人会很快适应。
16、其实现在,随着 AI 的成熟,最可怕的问是 AI 会不会让人的认知能力逐渐退化。AI 可以帮我们查资料、写代码、分析问,甚至直接给出结论。
效率确实提高了,但人也可能因此不断跳过理解、推理和验证的过程。时间久了,我们也许还能完成工作,却越来越说不清结果为什么成立,系统出了问也不知道该从哪里判断。
这一点我也深有感受。其实就像计算机出现之后,我是觉得人类的记忆力是有衰退的。举个例子,比如导航的存在会让很多人不认路了。
随着越来越多思考被交给 AI,真正需要保留的,是对事物的基本理解、独立判断和形成观点的能力。否则,人类外包出去的不只是工作量,还可能包括自己的判断力、品味和世界观。
但这部分也是一个社会问。因为人毕竟会本能地选择更省力的方式。一旦 AI 可以更快、更便宜地给出答案,大多数人很难长期坚持自己查资料、推理和验证。只靠个人自律,恐怕解决不了认知退化的问。
@aigc1024
这期播客,他从 OpenAI 为什么收缩业务、为什么疯狂囤算力,一直聊到 Kimi、开源模型、机器人和人在 AI 时代的价值。很多问都讲得很具体。我总结下自己的收获。
1、OpenAI 过去一年最大的问是不聚焦。2025 年初,他们还不确定 AI 收入能不能支撑已经签下的巨量算力,所以一度考虑过做更多的 ToC 产品,甚至后来还成立了单独的应用事业部,核心思路就是希望在模型需求增长不及预期时,也能找到其他方式消化 GPU。
但后来模型收入快速增长,AI 的经济回报逐渐明确,OpenAI 才决定砍掉一部分探索,把资源重新集中到模型、算力和核心产品上。
2、Sam 说现在 OpenAI 的定位已经很清楚了,他们的核心业务,是生产足够好、足够便宜的智能,再让其他公司基于这些智能开发新的产品。
为此,OpenAI 需要同时处理模型、芯片、服务器机架、土地、电力、数据中心,未来甚至还需要用机器人降低整个供应链的成本。
他们没有兴趣,也没有能力亲自做完所有垂直应用,更希望 OpenAI 成为智能时代的底层平台。
3、OpenAI 之所以敢提前锁定巨量算力,核心判断是 AI 的需求几乎没有上限。这一点和梁文锋的判断很像。
电脑刚出现的时候,人们认为全世界只需要几台电脑,但每次计算成本下降,人类都会创造出新的需求。
模型越强、价格越低,人们就越愿意让 AI 承担更多工作。OpenAI 做的事情,本质上是把电力转化成有用的智能。
4、真正让 OpenAI 对这条路线建立信心的模型,是 GPT-4,不是 GPT-3.5。GPT-4 让他们第一次确认,模型已经聪明到足以继续解决推理问。
一旦推理能力成熟,模型就能从回答问,走向执行任务,也就是后来大家所说的 Agent。Sam 当时已经相信,这些 Agent 可以承担大量真实的经济工作。
5、去年推动大规模算力采购时,几乎没有多少人相信这件事。很多云厂商、芯片工厂和能源公司都觉得,AI 需求不可能长期高速增长,OpenAI 提出的采购规模也太激进。
Sam 说他当时的心态很像早期创业融资,大多数人拒绝并不重要,关键是逐个去谈,先找到一两个愿意下注的人。这一点
中美机器人整机销售肯定是脱钩的,FF贾老板那套思路(类似温州生产意大利贴标)其实是work的,但他们没有认真做。
美国很难搓出来完整供应链,在政策和外贸上游说永远比从零建厂容易,路径依赖。
@aigc1024
美国很难搓出来完整供应链,在政策和外贸上游说永远比从零建厂容易,路径依赖。
@aigc1024
Chat2DB Community 免费、跨平台(Win / macOS / Linux),完全本地运行。
支持 30+ 数据库:MySQL、PostgreSQL、Oracle、SQL Server、ClickHouse、MongoDB、Redis……
核心能力:
• SQL 工作空间(编辑、补全、执行、历史)
• 接入自己的 AI 模型,自然语言生成 / 解释 / 优化 SQL
• 表结构管理 + 在线改数据
• 导入导出、Dashboard、图表
一个客户端搞定多数据库 + AI 写 SQL。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
蹬Codex的朋友们注意了!分享个好东西~刚发现一个 Codex Radar 雷达站,极其牛批,纯免费公益!
简单说说功能吧:
1、时时刻刻盯着 Tibo 动态来预测重置时间,方便你蹬,预测准确率强;
2、GPT降智问是大家经常担心的点,它通过实时的真实开源任务、众包运行以及独立的评分机制对其进行追踪,方便了解当前智力状态。
3、分布式雷达目前主要使用 DeepSWE 真实开源仓库任务,并通过持续复测观察模型变化。
Codex 雷达负责“看结果、读趋势、做选择”,分布式雷达负责“跑测试、产数据、验结果”。
使用Codex雷达的两种方式:
📡codexradar.com — 一个简洁的仪表板,用于追踪 Codex IQ、成本、速度及性能方面的变化。
🛰️deng.codexradar.com — 实时社区基准平台,您可在此运行真实的开源任务并贡献数据。
主站目前日活跃访问量约三万至四万,月活跃访问量约三十万,粉丝群搞了40个了。有点东西。
(ps.某鹅厂实验室朋友的业余作品.....)
@aigc1024
简单说说功能吧:
1、时时刻刻盯着 Tibo 动态来预测重置时间,方便你蹬,预测准确率强;
2、GPT降智问是大家经常担心的点,它通过实时的真实开源任务、众包运行以及独立的评分机制对其进行追踪,方便了解当前智力状态。
3、分布式雷达目前主要使用 DeepSWE 真实开源仓库任务,并通过持续复测观察模型变化。
Codex 雷达负责“看结果、读趋势、做选择”,分布式雷达负责“跑测试、产数据、验结果”。
使用Codex雷达的两种方式:
📡codexradar.com — 一个简洁的仪表板,用于追踪 Codex IQ、成本、速度及性能方面的变化。
🛰️deng.codexradar.com — 实时社区基准平台,您可在此运行真实的开源任务并贡献数据。
主站目前日活跃访问量约三万至四万,月活跃访问量约三十万,粉丝群搞了40个了。有点东西。
(ps.某鹅厂实验室朋友的业余作品.....)
@aigc1024
给 AI 和 Agent 界面用的思考球加载动画 React 组件。六种动画状态、两种尺寸,纯 2D Canvas 画,自动切暗/亮主。
https://github.com/Jakubantalik/thinking-orbs
AI探索 | Hermes/OpenClaw|优质资源|优质信息
https://github.com/Jakubantalik/thinking-orbs
AI探索 | Hermes/OpenClaw|优质资源|优质信息
英伟达CEO黄仁勋最新采访说:华尔街又误解了中国AI模型!
DeepSeek上次被误解,这次Kimi又来了。他认为:开源的便宜中国模型会让AI变得更普及、使用量大增,反而会拉动更多显卡和数据中心需求,对NVIDIA是大利好!
AI探索 | Hermes/OpenClaw|优质资源|优质信息
DeepSeek上次被误解,这次Kimi又来了。他认为:开源的便宜中国模型会让AI变得更普及、使用量大增,反而会拉动更多显卡和数据中心需求,对NVIDIA是大利好!
AI探索 | Hermes/OpenClaw|优质资源|优质信息
最近半年,模型的训练是在 agentic coding 方面一直突飞猛进 RLVR
但在其他领域却止步不前
甚至英文写作都开始倒推了
模型说的越来越难懂了
模型的泛化,并没有真正发生
Opus 从 4.7 到 5 完全都是失败的试验品
Mythos 和 Fable 也都是刚出来没太多 RL 的时候最好
RLVR 之后,我们也许需要一些新的 RL
@aigc1024
很多提示词和 Skill,都已经过时了。
Anthropic 的工程师发了一篇文章,提到他们针对 Claude Opus 5、Claude Fable 5 这一代新模型,团队把 Claude Code 的系统提示词删掉了 80% 以上,结果在代码评测里没有看到明显损失。
这件事至少说明,在 AI 快速变化的节奏里,很多所谓的最佳实践,保质期可能非常短。
模型能力一直在提升,一些过去必须反复强调的规则,今天可能已经没有价值,甚至会限制模型的表现。
我也想借这个机会,写一下最近关于提示词和 Skill 的一些真实经验和思考,希望能够给大家一些启发。
一、提示词依然重要
现在很多人会觉得,提示词已经没有什么意义了。
这对了一半。过去那种八股文式的提示词,价值确实越来越低。比如先给 AI 设定一个复杂角色:
你是一位资深的新媒体编辑,熟悉互联网行业,拥有十年写作经验,请帮我优化这篇文章。
这类角色预置,在新模型上的作用已经没有过去那么明显。模型本身知道编辑是怎么工作的,也知道一篇文章大概要怎么修改。
但这不代表提示词不重要。
如果把提示词换成另一个词,它其实就是:我们怎么跟 AI 沟通。
就像我们和人沟通一样,同样让一个人完成一件事,不同的沟通方式,最后得到的结果也可能完全不同。
所以,我现在更愿意把提示词理解成一种沟通思路。你怎么描述问,怎么拆解任务,怎么告诉 AI 你真正关心什么,这些依然无比重要。
比如,我想让 AI 帮我总结一篇论文,我很少只说总结一下这篇论文。
我通常会告诉它:
这篇论文主要解决了什么问?作者是怎么解决的?这个方法和过去的方法相比,真正的变化是什么?
这样问之后,AI 的回答通常会更容易抓住论文的主线。
因为我没有只给它一个模糊的动作,而是告诉了它,我想从哪些角度理解这篇论文。
二、少做角色预置,把任务说清楚
过去写提示词,大家喜欢铺垫很多背景。
先设定角色,再描述能力,然后补充语气、风格、工作流程,最后才说真正要完成什么。
提示词写了几百字,核心任务可能只有一句。
现在我觉得,这些铺垫很多时候已经没有必要。
提示词里真正重要的,是把几件事情分开说清楚。包括这次要达到什么目标,规则或者流程是什么,怎么才算完成。
比如,整理一段语音底稿,可以这样写:
把下面的语音底稿整理成一篇可以继续修改的公众号初稿。
删除重复的口头禅,合并意思相近的内容,调整明显跳跃的段落。
注意保留原来的核心判断,不主动增加新的观点、案例和结论。
完成标准是读者能够看清文章在讨论什么,作者的核心判断是什么,以及这些判断之间有什么关系。
我现在越来越觉得,好的提示词不需要写得复杂,先把这几件事情想清楚,已经解决了大部分问。
其实就像把一件事交代给同事,你怎么说,他才更容易理解。
三、规则需要有,但不要太多
有一段时间,我看到特别长的提示词,会觉得非常专业,恨不得马上保存下来。
现在的感受刚好相反。
一条提示词特别长,很多时候说明写提示词的人自己也没有完全想清楚。
他只是把可能遇到的问全部堆了进去,希望模型自己处理。
规则当然需要。
比如我在写作时发现,模型经常大量使用单字动词,文章读起来会比较硬。
我不喜欢这种表达,就会明确告诉它尽量使用更准确的双字动词,但不要为了凑字显得生硬。
这属于稳定的个人偏好,告诉模型是有价值的。但规则太多就会出现问。
比如你同时要求语言简洁、内容详细、不要长句、不要太口语、不要调整原文节奏、同时优化文章结构......
这些规则很容易打架。
毕竟模型必须先花费大量精力理解哪一条规则优先,最后可能每一条都照顾了一点,但整体效果反而下降。
新模型已经具备比较强的推理和判断能力。提示词不需要提前规定每一个动作,只需要保留那些真正重要的规则。
规则越多,不一定代表控制越精确,也可能代表人没有完成取舍。
四、要不要提供示例,要具体情况具体看
以前写提示词,还有一个非常常见的做法,就是提供大量示例。
这个方法当然有效,但我现在越来越谨慎。
因为示例一方面能够帮助模型理解我们的要求,另一方面也会限制模型的探索空间。
尤其是模型能力越来越强以后,它有时候会过度模仿示例,最后只能在示例附近生成答案。
所以,要不要提供示例,我觉得不能一概而论。需要自己结合具体的情况去试。
现在,我大部分的情况下,都默认不提供示例。
比如让 AI 帮忙写文章开头,我提供了示例,它基本就照猫画虎了,很刻意。
其实这时候,我们可以把自己思路说的更具体点,比如:
这个开头可以考虑从一个具体故事进入,也可以从一组反常的数据进入,或者从我最近的一个真实感受进入。
这并没有规定开头必须怎么写,但给了模型几个明确的思考方向。
所以,仍然是那句,思路非常重要。
五、告诉模型,什么样才算完成
这也是我最近非常重视的一点。
我们经常告诉 AI 要完成什么,却很少告诉它,什么样的结果才算完成。
比如让 AI 总结一篇文章,最简单的提示词是:
总结这篇文章。
但你也可以写成:
总结这篇文章。完成后,我希望能够回答三个问:作者发现了什么变化?为什么会发生这种变化?这件事对普通从业者有什么影响?
这相当于给模型提供了一个简单的验收标准。
再比如,让 AI 完成一份产品分析,可以说:
最终结论需要能够帮助团队做出产品决策,不能只介绍产品有哪些功能。
这个要求就比请深入分析这个产品清楚很多。
深入是一个非常模糊的形容词。什么叫深入,每个人的理解都不一样。但能不能支持产品决策,是一个可以检查的标准。
说完提示词,再说 Skill。Skill 就是一份按需加载的小型工作手册。但并不是每一个提示词、每一个场景,都适合做成 Skill。
一、经常发生、流程稳定的事情,才适合做成 Skill
我觉得一类任务想要做成 Skill,至少要满足几个条件:
第一,它经常发生。第二,它的工作流程相对稳定。第三,里面包含一些模型本身不知道的个人经验、团队经验或者业务知识。
这些事情会反复出现,处理方式也相对稳定,适合慢慢沉淀成 Skill。
但某一篇文章的具体观点和材料,没有必要放进 Skill。它们只和当前任务相关,直接作为参考材料提供给模型就可以了。
没必要把所有东西都做成 Skill。
Agent 在运行时,即便没有加载 Skill 的全部内容,通常也需要先读取它的名称、简介和适用范围。这些基础信息同样会进入上下文,对模型的判断产生影响。
Skill 越多,不代表 Agent 越强。大量边界模糊的 Skill,也可能让模型不知道该调用哪一个。
二、Skill 里要放独特经验
我觉得一个 Skill 最有价值的地方,绝对不是那些网上随便就能找到的常识。
比如你在写作 Skill 里写文章要有逻辑、标要有吸引力,这些内容模型本来就知道,写进去不会带来太大帮助。
真正有价值的是你自己的经验。
比如,修改语音底稿时,要保留口语里的活人感,每个核心判断最好有一个事实、数据或者亲身经历支撑。
这些内容代表了我们的个人品味、工作经验和业务知识。把这些经验编码进 Skill,才是 Skill 真正的价值。
三、Skill 需要控制抽象程度和边界
很多 Skill 的问,是解决问的范围太大。
比如一个叫写作的 Skill,边界就非常模糊。写作包括选、资料阅读、形成观点、整理初稿、修改结构、优化语言、生成标、检查错别字。
每一个环节需要的经验和评价标准都不一样。
把所有东西都放进同一个 Skill,最后这个 Skill 只会越来越长。
所以我觉得,Skill 最好只解决一个相对明确的问。比如口述内容整理 Skill、标生成 Skill、事实核查 Skill。
Skill 的边界越清楚,模型越容易判断什么时候调用,也越容易把它做好。
四、Skill 的主文件应该尽量短
Skill 通常是一个文件夹。
里面可以包含主文件、参考案例、常见问、风格规范、检查清单,以及其他辅助材料。
所以没有必要把所有内容都写进主文件。
主文件只需要告诉模型:这个 Skill 什么时候使用、它主要解决什么问、有哪些核心原则、默认按照什么思路推进、遇到具体问时,可以继续读取哪些参考文件。
至于详细示例、风格要求、常见错误,可以放进单独的文件,等模型真正需要时再加载。
主文件是一张地图。模型先看地图,判断这次任务需要哪些内容,再继续读取相应的文件。
这就是渐进式加载。
不需要的内容不要提前塞给模型。这样既能减轻上下文负担,也能够减少不同规则之间的冲突。
五、Skill 最好包含检查环节
这一点和提示词非常接近。
只告诉模型怎么生成,往往还不够。一个好的 Skill,最好包含一套简单的自检标准。
比如产品体验稿 Skill,可以检查:有没有写清楚真实使用场景、有没有说明过去的方法有什么问、有没有只有功能,没有判断。
这些自检标准,也是在告诉模型什么样才算完成。
一个 Skill 的价值,不能只体现在生成过程,还要体现在它能够帮助模型判断结果是否合格。
@aigc1024
Anthropic 的工程师发了一篇文章,提到他们针对 Claude Opus 5、Claude Fable 5 这一代新模型,团队把 Claude Code 的系统提示词删掉了 80% 以上,结果在代码评测里没有看到明显损失。
这件事至少说明,在 AI 快速变化的节奏里,很多所谓的最佳实践,保质期可能非常短。
模型能力一直在提升,一些过去必须反复强调的规则,今天可能已经没有价值,甚至会限制模型的表现。
我也想借这个机会,写一下最近关于提示词和 Skill 的一些真实经验和思考,希望能够给大家一些启发。
一、提示词依然重要
现在很多人会觉得,提示词已经没有什么意义了。
这对了一半。过去那种八股文式的提示词,价值确实越来越低。比如先给 AI 设定一个复杂角色:
你是一位资深的新媒体编辑,熟悉互联网行业,拥有十年写作经验,请帮我优化这篇文章。
这类角色预置,在新模型上的作用已经没有过去那么明显。模型本身知道编辑是怎么工作的,也知道一篇文章大概要怎么修改。
但这不代表提示词不重要。
如果把提示词换成另一个词,它其实就是:我们怎么跟 AI 沟通。
就像我们和人沟通一样,同样让一个人完成一件事,不同的沟通方式,最后得到的结果也可能完全不同。
所以,我现在更愿意把提示词理解成一种沟通思路。你怎么描述问,怎么拆解任务,怎么告诉 AI 你真正关心什么,这些依然无比重要。
比如,我想让 AI 帮我总结一篇论文,我很少只说总结一下这篇论文。
我通常会告诉它:
这篇论文主要解决了什么问?作者是怎么解决的?这个方法和过去的方法相比,真正的变化是什么?
这样问之后,AI 的回答通常会更容易抓住论文的主线。
因为我没有只给它一个模糊的动作,而是告诉了它,我想从哪些角度理解这篇论文。
二、少做角色预置,把任务说清楚
过去写提示词,大家喜欢铺垫很多背景。
先设定角色,再描述能力,然后补充语气、风格、工作流程,最后才说真正要完成什么。
提示词写了几百字,核心任务可能只有一句。
现在我觉得,这些铺垫很多时候已经没有必要。
提示词里真正重要的,是把几件事情分开说清楚。包括这次要达到什么目标,规则或者流程是什么,怎么才算完成。
比如,整理一段语音底稿,可以这样写:
把下面的语音底稿整理成一篇可以继续修改的公众号初稿。
删除重复的口头禅,合并意思相近的内容,调整明显跳跃的段落。
注意保留原来的核心判断,不主动增加新的观点、案例和结论。
完成标准是读者能够看清文章在讨论什么,作者的核心判断是什么,以及这些判断之间有什么关系。
我现在越来越觉得,好的提示词不需要写得复杂,先把这几件事情想清楚,已经解决了大部分问。
其实就像把一件事交代给同事,你怎么说,他才更容易理解。
三、规则需要有,但不要太多
有一段时间,我看到特别长的提示词,会觉得非常专业,恨不得马上保存下来。
现在的感受刚好相反。
一条提示词特别长,很多时候说明写提示词的人自己也没有完全想清楚。
他只是把可能遇到的问全部堆了进去,希望模型自己处理。
规则当然需要。
比如我在写作时发现,模型经常大量使用单字动词,文章读起来会比较硬。
我不喜欢这种表达,就会明确告诉它尽量使用更准确的双字动词,但不要为了凑字显得生硬。
这属于稳定的个人偏好,告诉模型是有价值的。但规则太多就会出现问。
比如你同时要求语言简洁、内容详细、不要长句、不要太口语、不要调整原文节奏、同时优化文章结构......
这些规则很容易打架。
毕竟模型必须先花费大量精力理解哪一条规则优先,最后可能每一条都照顾了一点,但整体效果反而下降。
新模型已经具备比较强的推理和判断能力。提示词不需要提前规定每一个动作,只需要保留那些真正重要的规则。
规则越多,不一定代表控制越精确,也可能代表人没有完成取舍。
四、要不要提供示例,要具体情况具体看
以前写提示词,还有一个非常常见的做法,就是提供大量示例。
这个方法当然有效,但我现在越来越谨慎。
因为示例一方面能够帮助模型理解我们的要求,另一方面也会限制模型的探索空间。
尤其是模型能力越来越强以后,它有时候会过度模仿示例,最后只能在示例附近生成答案。
所以,要不要提供示例,我觉得不能一概而论。需要自己结合具体的情况去试。
现在,我大部分的情况下,都默认不提供示例。
比如让 AI 帮忙写文章开头,我提供了示例,它基本就照猫画虎了,很刻意。
其实这时候,我们可以把自己思路说的更具体点,比如:
这个开头可以考虑从一个具体故事进入,也可以从一组反常的数据进入,或者从我最近的一个真实感受进入。
这并没有规定开头必须怎么写,但给了模型几个明确的思考方向。
所以,仍然是那句,思路非常重要。
五、告诉模型,什么样才算完成
这也是我最近非常重视的一点。
我们经常告诉 AI 要完成什么,却很少告诉它,什么样的结果才算完成。
比如让 AI 总结一篇文章,最简单的提示词是:
总结这篇文章。
但你也可以写成:
总结这篇文章。完成后,我希望能够回答三个问:作者发现了什么变化?为什么会发生这种变化?这件事对普通从业者有什么影响?
这相当于给模型提供了一个简单的验收标准。
再比如,让 AI 完成一份产品分析,可以说:
最终结论需要能够帮助团队做出产品决策,不能只介绍产品有哪些功能。
这个要求就比请深入分析这个产品清楚很多。
深入是一个非常模糊的形容词。什么叫深入,每个人的理解都不一样。但能不能支持产品决策,是一个可以检查的标准。
说完提示词,再说 Skill。Skill 就是一份按需加载的小型工作手册。但并不是每一个提示词、每一个场景,都适合做成 Skill。
一、经常发生、流程稳定的事情,才适合做成 Skill
我觉得一类任务想要做成 Skill,至少要满足几个条件:
第一,它经常发生。第二,它的工作流程相对稳定。第三,里面包含一些模型本身不知道的个人经验、团队经验或者业务知识。
这些事情会反复出现,处理方式也相对稳定,适合慢慢沉淀成 Skill。
但某一篇文章的具体观点和材料,没有必要放进 Skill。它们只和当前任务相关,直接作为参考材料提供给模型就可以了。
没必要把所有东西都做成 Skill。
Agent 在运行时,即便没有加载 Skill 的全部内容,通常也需要先读取它的名称、简介和适用范围。这些基础信息同样会进入上下文,对模型的判断产生影响。
Skill 越多,不代表 Agent 越强。大量边界模糊的 Skill,也可能让模型不知道该调用哪一个。
二、Skill 里要放独特经验
我觉得一个 Skill 最有价值的地方,绝对不是那些网上随便就能找到的常识。
比如你在写作 Skill 里写文章要有逻辑、标要有吸引力,这些内容模型本来就知道,写进去不会带来太大帮助。
真正有价值的是你自己的经验。
比如,修改语音底稿时,要保留口语里的活人感,每个核心判断最好有一个事实、数据或者亲身经历支撑。
这些内容代表了我们的个人品味、工作经验和业务知识。把这些经验编码进 Skill,才是 Skill 真正的价值。
三、Skill 需要控制抽象程度和边界
很多 Skill 的问,是解决问的范围太大。
比如一个叫写作的 Skill,边界就非常模糊。写作包括选、资料阅读、形成观点、整理初稿、修改结构、优化语言、生成标、检查错别字。
每一个环节需要的经验和评价标准都不一样。
把所有东西都放进同一个 Skill,最后这个 Skill 只会越来越长。
所以我觉得,Skill 最好只解决一个相对明确的问。比如口述内容整理 Skill、标生成 Skill、事实核查 Skill。
Skill 的边界越清楚,模型越容易判断什么时候调用,也越容易把它做好。
四、Skill 的主文件应该尽量短
Skill 通常是一个文件夹。
里面可以包含主文件、参考案例、常见问、风格规范、检查清单,以及其他辅助材料。
所以没有必要把所有内容都写进主文件。
主文件只需要告诉模型:这个 Skill 什么时候使用、它主要解决什么问、有哪些核心原则、默认按照什么思路推进、遇到具体问时,可以继续读取哪些参考文件。
至于详细示例、风格要求、常见错误,可以放进单独的文件,等模型真正需要时再加载。
主文件是一张地图。模型先看地图,判断这次任务需要哪些内容,再继续读取相应的文件。
这就是渐进式加载。
不需要的内容不要提前塞给模型。这样既能减轻上下文负担,也能够减少不同规则之间的冲突。
五、Skill 最好包含检查环节
这一点和提示词非常接近。
只告诉模型怎么生成,往往还不够。一个好的 Skill,最好包含一套简单的自检标准。
比如产品体验稿 Skill,可以检查:有没有写清楚真实使用场景、有没有说明过去的方法有什么问、有没有只有功能,没有判断。
这些自检标准,也是在告诉模型什么样才算完成。
一个 Skill 的价值,不能只体现在生成过程,还要体现在它能够帮助模型判断结果是否合格。
@aigc1024
AI 越强,人越喜欢单干。人越单干,会到某一天猛然发现,人与人之间的专业协作必不可少。
AI 很容易让一个人的长处变得更长,同时让一个人的短处得到些微弥补。AI 有个陷阱是,很容易让人的短处变成迷障。以为通过 AI,能让自己学会之前不懂的。实际往往只是通过 AI 学了皮毛,内心里却滋生了狂妄。
@aigc1024
AI 很容易让一个人的长处变得更长,同时让一个人的短处得到些微弥补。AI 有个陷阱是,很容易让人的短处变成迷障。以为通过 AI,能让自己学会之前不懂的。实际往往只是通过 AI 学了皮毛,内心里却滋生了狂妄。
@aigc1024