关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
Jev 这个决策模型非常有意思。
它不做长文生成,只做三类事:
1. 布尔判断(要不要联网、要不要退出循环)
2. 枚举选择(Agent 走 fast / plan、调哪个模型、分发给哪个 Bot)
3. 候选打分(给多个选项打分,再按分数排序)
TypeSafe 把 Jev 定位成 System One:靠快、直觉式的判断做决策。对应的是偏 System Two 的生成式模型——慢而细地推理,再输出文本。
几个很经典的落地场景:
1. 搜索意图识别
AI 搜索产品为了省搜索 API,一般会先打一枪 flash 模型做意图识别,根据 mode: chat / search 再决定要不要联网,用户往往要多等 1–2 秒。Perplexity 一类产品会把这类分流做成专用分类器,压到毫秒级。接入 Jev 后,用枚举选择 mode、或用布尔判断「要不要联网」,就能在不必自训小模型的前提下,把这道闸门做得更快、更便宜。
2. 本地模型网关
本地部署的 Agent(比如 OpenClaw),后面挂了一堆模型 API,token 成本很高。需要一层网关:日常对走 DeepSeek 之类的 flash,写代码走 Claude 之类的 SOTA。用 Jev 做枚举选择,可以把 query 快速路由到够用且更合适的模型。
3. 多 Agent 协作
不同 Bot 能力不同。群里发布任务后,Leader 要按成员能力分派。用 Jev 做候选打分,就能挑出更匹配的一组 Bot 来协作完成任务。
---
Jev 已在 OpenRouter 上线,但不兼容 OpenAI Chat Completions 格式,要用 Decisions API 自行拼 state + questions。
大家的 Agent 产品都可以接起来了。✌️
@aigc1024
它不做长文生成,只做三类事:
1. 布尔判断(要不要联网、要不要退出循环)
2. 枚举选择(Agent 走 fast / plan、调哪个模型、分发给哪个 Bot)
3. 候选打分(给多个选项打分,再按分数排序)
TypeSafe 把 Jev 定位成 System One:靠快、直觉式的判断做决策。对应的是偏 System Two 的生成式模型——慢而细地推理,再输出文本。
几个很经典的落地场景:
1. 搜索意图识别
AI 搜索产品为了省搜索 API,一般会先打一枪 flash 模型做意图识别,根据 mode: chat / search 再决定要不要联网,用户往往要多等 1–2 秒。Perplexity 一类产品会把这类分流做成专用分类器,压到毫秒级。接入 Jev 后,用枚举选择 mode、或用布尔判断「要不要联网」,就能在不必自训小模型的前提下,把这道闸门做得更快、更便宜。
2. 本地模型网关
本地部署的 Agent(比如 OpenClaw),后面挂了一堆模型 API,token 成本很高。需要一层网关:日常对走 DeepSeek 之类的 flash,写代码走 Claude 之类的 SOTA。用 Jev 做枚举选择,可以把 query 快速路由到够用且更合适的模型。
3. 多 Agent 协作
不同 Bot 能力不同。群里发布任务后,Leader 要按成员能力分派。用 Jev 做候选打分,就能挑出更匹配的一组 Bot 来协作完成任务。
---
Jev 已在 OpenRouter 上线,但不兼容 OpenAI Chat Completions 格式,要用 Decisions API 自行拼 state + questions。
大家的 Agent 产品都可以接起来了。✌️
@aigc1024
最稳大平台,点击以下链接认证
😍 世博联盟-联盛担保1000万U😍 okapy钱包-ok28担保上押300万U😍 8G国际娱乐官方福利群 公开透明
广电总局表态,真人剧是精品创作的主力!要大力扶持!!
实施真人微短剧精品创作计划,真金白银扶持,指导平台开真人剧专区。
总局这个表态其实没有打压AI短剧,但根据多个平台一刀切的习惯,AI短剧怕是没有那么舒服了!
只有真正意义上的好的AI剧作,才有生存的空间。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
体(subagent),运行了 2400 条命令,写了数百个 Python 脚本。这些子智能体之间分工明确:2 个负责核心数学思路,13 个为它们提供想法,30 个尝试但未能提出新思路,13 个做验证,2 个帮忙写论文。
整个过程中 Jarred 的参与基本限于给 Claude 打气,发的消息大多是“继续”和“相信自己”。
Anthropic 说,这种鼓励似乎帮助 Claude 克服了“我真的能在这种级别的问上有所推进吗”的自我怀疑。
这已经是 Claude 今年第二次在数学领域搞出大新闻了。三周前,Anthropic 的数学家 Levent Alpöge 用 Claude Fable 5 找到了 Jacobian 猜想(Jacobian Conjecture)的反例,推翻了这个 87 年历史的代数几何猜想的一般形式。那次的反例简洁到人类数学家一天之内就能手动验证。
两次事件有一个共同点:Claude 做的不是解,而是原创性的数学研究,是在数学家们几十年没能推进的前沿问上找到了新路径。
Anthropic 也明确表示,Claude 使用的技术不太可能直接导向黎曼猜想的最终证明,但这个结果展示了 AI 模型在数学能力上的进步速度。
Anthropic 公布了 Claude 的完整论文、Lean 形式化证明、简明证明笔记,以及 Claude 自己描述思路演化过程的附录,都可以在 Anthropic 官网的研究页面找到。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
整个过程中 Jarred 的参与基本限于给 Claude 打气,发的消息大多是“继续”和“相信自己”。
Anthropic 说,这种鼓励似乎帮助 Claude 克服了“我真的能在这种级别的问上有所推进吗”的自我怀疑。
这已经是 Claude 今年第二次在数学领域搞出大新闻了。三周前,Anthropic 的数学家 Levent Alpöge 用 Claude Fable 5 找到了 Jacobian 猜想(Jacobian Conjecture)的反例,推翻了这个 87 年历史的代数几何猜想的一般形式。那次的反例简洁到人类数学家一天之内就能手动验证。
两次事件有一个共同点:Claude 做的不是解,而是原创性的数学研究,是在数学家们几十年没能推进的前沿问上找到了新路径。
Anthropic 也明确表示,Claude 使用的技术不太可能直接导向黎曼猜想的最终证明,但这个结果展示了 AI 模型在数学能力上的进步速度。
Anthropic 公布了 Claude 的完整论文、Lean 形式化证明、简明证明笔记,以及 Claude 自己描述思路演化过程的附录,都可以在 Anthropic 官网的研究页面找到。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
它把黎曼 ζ 函数的非平凡零点落在临界线上的已知比例下界,从 41.6% 提高到了 67.2%。
黎曼猜想是数学界最著名的未解难之一,1859 年提出,至今 167 年无人能证明或推翻。它的核心主张是:黎曼 ζ 函数的所有非平凡零点都落在复平面上一条特定的竖直线上,数学家称之为“临界线”。
如果这个猜想成立,素数的分布就有了一种深层的规律性。这个问列在克雷数学研究所的七大千禧年问之中,悬赏 100 万美元。
既然全面证明太难,数学家们退而求其次:
能不能至少证明有多大比例的零点确实在这条线上?
这个方向上的进展,过去 80 年是这样的:
- 1942 年 Selberg 首次证明有正比例的零点在线上,但比例很小;
- 1974 年 Levinson 证明至少三分之一;
- 1989 年 Conrey 推到五分之二;
- 此后又经历了几代数学家的努力,到 2020 年 Pratt 等人才把这个数字推到 41.7%。
换句说,从 33% 到 41.7%,人类花了将近 50 年。Claude 一步跳到 67.2%,跨度接近 26 个百分点,是这个问历史上最大的一次单步提升。
Claude 的发现建立在前人的工作之上。它结合了 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 近年发表的一系列成果,以及数学家 Bombieri 在 2000 年的一篇论文。这些工作本身已经为突破铺好了路,而 Claude 找到了把它们拼在一起的方法。
Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 审查验证了 Claude 的证明,外部专家 Brian Conrey 和 Dan Goldston 也在短时间内审阅了论文。Claude 还用 Lean(一种形式化证明语言)写出了可机器验证的证明。
过程本身和结果一样有故事。Anthropic 的一位员工 Jarred Sumner(不是数学家)在 Claude Code 中对 Claude 说了一句“认真试试黎曼猜想”,然后就把数学决策交给了模型。
Claude 先生成了 650 个想法,全部失败。被鼓励再试一次后,它花了一天半时间协调大约 60 个子智能
国学不懂、经典不背,AI 自己替你把内容吐出来,新号照样能跑量。
情绪金句搭古风画面,再配节奏剪辑,完播高、推荐稳、涨粉猛。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
Mindjourney 收购了一家算命公司:Co–Star
传统星座运势一般只看出生月份(太阳星座),而 Co–Star 需要精确到出生的具体分钟和出生地点。
它结合了 NASA 的行星数据 和专业占星师的方法,用 AI 算法实时跟踪天体轨迹,帮你生成超精准的性格分析和未来运势预测。😅
而且你可以在 App 里社交、交友,随时查看他们的星盘和运势,甚至能测算你们俩是不是“天生一对”或者今天适不适合聊天。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
传统星座运势一般只看出生月份(太阳星座),而 Co–Star 需要精确到出生的具体分钟和出生地点。
它结合了 NASA 的行星数据 和专业占星师的方法,用 AI 算法实时跟踪天体轨迹,帮你生成超精准的性格分析和未来运势预测。😅
而且你可以在 App 里社交、交友,随时查看他们的星盘和运势,甚至能测算你们俩是不是“天生一对”或者今天适不适合聊天。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
我还以为是进蟑螂了
原来是电机这里有个很多余的盖板
这个盖板留了个缝隙进猫毛
里边还有好几个棱帮忙团猫毛
猫毛在里边被团个一个大疙瘩
塞住了转轴
拆掉盖板裸奔之后再也不报警了
美的这扫地机器人的结构设计不行
🤡
@aigc1024
让 AI 回测 1995 年 1 月买 1 万美元标普 500,分红全再投资:
- 标普 500:分红再投资大约 29.8 万
- 英特尔:48.54万 年化 13.0%
- 纳斯达克 100:73.99万 年化 14.5%
- 苹果:1188 万 年化 25.0%
AI探索 | Hermes/OpenClaw|优质资源|优质信息
我发现,几乎所有想靠 AI 赚钱的人,最后都会经历这五个阶段。
第一阶段:钻研技术。天天研究新模型、新工具、插件,skill,越学越兴奋。最容易产生一种幻觉:我懂了这么多别人不懂的东西,肯定能赚到钱。
于是进入第二阶段。
第二阶段:搞“一人公司”。觉得自己会 AI,就不应该再用传统方式做生意。运营、设计、程序员、客服,全部让 AI 干。一个人、一台电脑,顶一个团队。结果做了一阵才发现:Token 越烧越多,订阅费越来越高,钱却没赚到多少。这时候才明白:AI 只能提高效率,但如果你做的东西没人要,效率越高,只是更快地生产垃圾。于是进入第三阶段。
第三阶段:开始搞流量。你发现,产品再好,没人看见也没用。于是开始研究自媒体、标、短视频、算法、完播率、互动率、涨粉。以前研究的是:“AI 怎么用?”后来研究的是:“怎么让更多人看到我?”然后你会发现,AI 变现翻来覆去就那么几种:卖课、咨询、社群、定制开发、卖资料。于是进入第四阶段。
第四阶段:开始教别人赚钱。把自己踩过的坑、研究过的方法打包成产品。开始讲:“普通人怎么靠 AI 赚钱。”“我是怎么用 AI 涨粉的。”“一个人怎么靠 AI 做公司。”结果又发现,教人赚钱这条赛道早就挤满了。用户也被各种“副业”“搞钱”“认知课”割麻了。于是进入第五阶段。
第五阶段: 就是彻底佛系了,对AI去魅了。
极少人进入第六阶段:找到一个真正适合自己、有人愿意付钱,而且可以长期做的方向。把技术、流量、产品和商业模式真正串起来。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
第一阶段:钻研技术。天天研究新模型、新工具、插件,skill,越学越兴奋。最容易产生一种幻觉:我懂了这么多别人不懂的东西,肯定能赚到钱。
于是进入第二阶段。
第二阶段:搞“一人公司”。觉得自己会 AI,就不应该再用传统方式做生意。运营、设计、程序员、客服,全部让 AI 干。一个人、一台电脑,顶一个团队。结果做了一阵才发现:Token 越烧越多,订阅费越来越高,钱却没赚到多少。这时候才明白:AI 只能提高效率,但如果你做的东西没人要,效率越高,只是更快地生产垃圾。于是进入第三阶段。
第三阶段:开始搞流量。你发现,产品再好,没人看见也没用。于是开始研究自媒体、标、短视频、算法、完播率、互动率、涨粉。以前研究的是:“AI 怎么用?”后来研究的是:“怎么让更多人看到我?”然后你会发现,AI 变现翻来覆去就那么几种:卖课、咨询、社群、定制开发、卖资料。于是进入第四阶段。
第四阶段:开始教别人赚钱。把自己踩过的坑、研究过的方法打包成产品。开始讲:“普通人怎么靠 AI 赚钱。”“我是怎么用 AI 涨粉的。”“一个人怎么靠 AI 做公司。”结果又发现,教人赚钱这条赛道早就挤满了。用户也被各种“副业”“搞钱”“认知课”割麻了。于是进入第五阶段。
第五阶段: 就是彻底佛系了,对AI去魅了。
极少人进入第六阶段:找到一个真正适合自己、有人愿意付钱,而且可以长期做的方向。把技术、流量、产品和商业模式真正串起来。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
GPT-6 Astra 在 Minecraft 里一路打到 AI 新纪录,却被一只苦力怕炸光家当。
它立刻给自己写下规则:关键物品永远随身带。
结果接下来几小时只顾种土豆,还把甘蔗都当成苦力怕。
这就是 Agent 的真实难:一次失败,就可能让系统过度纠偏,从此困在错误规则里。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
它立刻给自己写下规则:关键物品永远随身带。
结果接下来几小时只顾种土豆,还把甘蔗都当成苦力怕。
这就是 Agent 的真实难:一次失败,就可能让系统过度纠偏,从此困在错误规则里。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
解决数学、量子复杂性和理论计算机科学中 10 个主要开放问的成本 = 不到 2000 美元
这意味着我们正在见证奇点(Singularity)的开端,或者奇点已经非常接近(就像再经过一两次顶级 AI 的迭代)
现在是数学,很快就是物理、化学和生物科学(诺贝尔级别的发现,超人速度)。数千个重大问以数千美元解决,之后很快只需几分钱。
进步速度加速 1000 倍。
旧世界在交叉点终结。超级智能时代现在开始。
生命科学不可想象的时代现在开始。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
https://modelscope.cn/active/ms-cookbook
继workbuddy蓝皮书、豆包工作蓝皮书之后,我们又整了个硬活儿,联合魔搭开源「开源模型紫皮书」~
从开源模型的选型、部署、微调、评测这些,带你从0到1打造自己的专属 AI 模型~!
欢迎star⭐和参与共建!
GitHub地址: https://github.com/modelscope/ms-cookbook
在线阅读:https://modelscope.cn/active/ms-cookbook
@aigc1024
想把某个实物或 emoji 变成体素图标时,Voxel Icon 提供一个装好即用的 Codex 技能,直接生成低密度等距体素图,需要动起来就额外输出四帧物理循环,不用再手工搭体素场景。
https://github.com/BIAsia/voxel-icon
oxel Icon 是 voxel-obj 的免费档,以自包含 Codex Skill 的形式交付,用来生成干净、俏皮、低密度的等距体素图标。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
https://github.com/BIAsia/voxel-icon
oxel Icon 是 voxel-obj 的免费档,以自包含 Codex Skill 的形式交付,用来生成干净、俏皮、低密度的等距体素图标。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
一篇看起来有道理的事实性文章很快,但逐句核实极其费时;宣称"最好的饮食是只吃野牛肉"只花 10 秒,但验证这个说法需要大样本和长期跟踪。
他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。
由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。
他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问:训练集和测试集是同一道,你就是想知道这一道的最优解。
这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。
三、智能的锯齿状边缘
对于"AI 将如何改变世界"这个问,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。
他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。
他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。
他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。
https://www.youtube.com/watch?v=b6Doq2fz81U
AI探索 | Hermes/OpenClaw|优质资源|优质信息
他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。
由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。
他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问:训练集和测试集是同一道,你就是想知道这一道的最优解。
这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。
三、智能的锯齿状边缘
对于"AI 将如何改变世界"这个问,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。
他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。
他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。
他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。
https://www.youtube.com/watch?v=b6Doq2fz81U
AI探索 | Hermes/OpenClaw|优质资源|优质信息