关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
我不知道我这个做法将会狠狠推进数学一大步,还是彻底终结数学。
党哥这里隆重推出The Last Math Competition(“最后数学竞赛”),可能将是全人类最后一场、也将是最旷日持久的一场数学竞赛。
https://github.com/The-Last-Math-Competition/The-Last-Math-Competition
以下是党哥制定的 The Last Math Competition 的规则:
1. 举办方每周会使用 AI Agent 新增 10000 个纯数学领域的猜想,添加到 ./conjectures 文件夹中;
2. 人类和 AI Agent 将共同对现存的所有猜想进行不同维度的打分,预估这些猜想证明或者证伪的难度,评价猜想的重要程度;
3. 人类和 AI Agent 可以共同提交对于每个猜想的完整证明,以 pull request 的形式提交在对应序号的文件夹中(比如 ./solutions/00000000001/my_submission_20260912041426),其中需要同时包含 LaTeX 源代码、PDF 文档和 Lean 4 项目,经过完整 review 后,完成证明或者证伪该猜想的提交将会被 merge 进来;
4. 举办方将会持续维护和更新一个含有所有猜想相关统计数据的表格。表格中的每一行对应一个猜想的所有信息,其中包括猜想的难度预估、重要程度打分、是否 well-defined、目前是否被证明或者证伪、第一次成功解决的时间、成功解决者的姓名和 affiliation 等信息;
5. 根据现存的猜想、对现存猜想的评估、对现存猜想的成功证明或者证伪,举办方将调整使用 AI Agent 生成猜想的策略,来逐步提高未来生成数学猜想的质量,以及可能逐步提高生成猜想的数量。
由于比赛尚在早期,我们必须声明:在早期生成的数学猜想的平均质量比较差,一部分猜想可能定义不充分或者存在错误的条件,或者存在显而易见的错误,甚至可能 "not even wrong"。所以我们将会根据对猜想的统计数据表格,来提升新生成猜想的质量和方法。
党哥的长远目标是:
1. 经过长期的比赛和反馈,我们将尝试逐步提升猜想质量。在长期大量猜想生成的过程中,我们希望能够创造若干重要猜想,通过对这些重要猜想的证明和证伪,来推动数学知识体系的推进;
2. 我们将探索以 AI Agent 为主导的数学研究和证明的技术路线。本比赛作为公开的比赛和 benchmark,将会实时评测所有模型的性能、harness 的性能、数学证明工具的性能,整个社区的所有参与者将一起探索 AI 时代科学研究的方法论;
3. 整个竞赛的所有猜想、对猜想的评估和打分、对猜想的最终证明或证伪,作为全世界 AI Agent 共同的经过验证和评议的知识成果,可以用于未来的数学研究,也可以用于未来的 LLM 训练。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
党哥这里隆重推出The Last Math Competition(“最后数学竞赛”),可能将是全人类最后一场、也将是最旷日持久的一场数学竞赛。
https://github.com/The-Last-Math-Competition/The-Last-Math-Competition
以下是党哥制定的 The Last Math Competition 的规则:
1. 举办方每周会使用 AI Agent 新增 10000 个纯数学领域的猜想,添加到 ./conjectures 文件夹中;
2. 人类和 AI Agent 将共同对现存的所有猜想进行不同维度的打分,预估这些猜想证明或者证伪的难度,评价猜想的重要程度;
3. 人类和 AI Agent 可以共同提交对于每个猜想的完整证明,以 pull request 的形式提交在对应序号的文件夹中(比如 ./solutions/00000000001/my_submission_20260912041426),其中需要同时包含 LaTeX 源代码、PDF 文档和 Lean 4 项目,经过完整 review 后,完成证明或者证伪该猜想的提交将会被 merge 进来;
4. 举办方将会持续维护和更新一个含有所有猜想相关统计数据的表格。表格中的每一行对应一个猜想的所有信息,其中包括猜想的难度预估、重要程度打分、是否 well-defined、目前是否被证明或者证伪、第一次成功解决的时间、成功解决者的姓名和 affiliation 等信息;
5. 根据现存的猜想、对现存猜想的评估、对现存猜想的成功证明或者证伪,举办方将调整使用 AI Agent 生成猜想的策略,来逐步提高未来生成数学猜想的质量,以及可能逐步提高生成猜想的数量。
由于比赛尚在早期,我们必须声明:在早期生成的数学猜想的平均质量比较差,一部分猜想可能定义不充分或者存在错误的条件,或者存在显而易见的错误,甚至可能 "not even wrong"。所以我们将会根据对猜想的统计数据表格,来提升新生成猜想的质量和方法。
党哥的长远目标是:
1. 经过长期的比赛和反馈,我们将尝试逐步提升猜想质量。在长期大量猜想生成的过程中,我们希望能够创造若干重要猜想,通过对这些重要猜想的证明和证伪,来推动数学知识体系的推进;
2. 我们将探索以 AI Agent 为主导的数学研究和证明的技术路线。本比赛作为公开的比赛和 benchmark,将会实时评测所有模型的性能、harness 的性能、数学证明工具的性能,整个社区的所有参与者将一起探索 AI 时代科学研究的方法论;
3. 整个竞赛的所有猜想、对猜想的评估和打分、对猜想的最终证明或证伪,作为全世界 AI Agent 共同的经过验证和评议的知识成果,可以用于未来的数学研究,也可以用于未来的 LLM 训练。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
我用Apodex研究了最近60天的AI视频爆款,做了一份《AI视频怎么选,才更容易有流量?》的深度报告,感兴趣的可以看看
AI探索 | Hermes/OpenClaw|优质资源|优质信息
https://assistantbenchmark.com/
它从邮件处理、旅行规划、购物、记忆和多步骤任务等维度,评估 AI 助手在真实使用中的表现。
想了解各家 AI 到底能帮你做哪些事、各自擅长什么,可以看看这个榜单。
@aigc1024
程序员的就业形势空前严峻!因为AI agent的能力空前强大,一篇表述清晰,没有歧义的需求文档丢给它,它两分钟就能完全理解透彻,十分钟内就能完成几百行甚至上千行规模的编码,而且基本上还没有多少bug,程序要只需要检视和测试一下就行了。
这让程序员怎么活?怎么办?
AI探索 | Hermes/OpenClaw|优质资源|优质信息
这让程序员怎么活?怎么办?
AI探索 | Hermes/OpenClaw|优质资源|优质信息
问:anthropic的报告会对kimi有什么影响?
答:
你为什么单独问kimi呢?
是因为他还没上市吗?
那为什么不问对deepseek的影响?
还是因为只有kimi是直接拿结果返回给用户吗?
以及kimi这家公司历史上出过的幺蛾子还少吗?
当然,这肯定会得罪一众kimi的亲朋好友……
随便吧……
@aigc1024
答:
你为什么单独问kimi呢?
是因为他还没上市吗?
那为什么不问对deepseek的影响?
还是因为只有kimi是直接拿结果返回给用户吗?
以及kimi这家公司历史上出过的幺蛾子还少吗?
当然,这肯定会得罪一众kimi的亲朋好友……
随便吧……
@aigc1024
时代变了,现在轮到AI Agent自己撸起袖子冲进交易场了。
HKUDS搞出来的这个AI-Trader,说白了就是给AI Agent量身打造的专属战场。
你根本不用跟代码死磕,只需甩给Agent一句人,它自己就会去读文档、自己注册账号,几秒钟就能杀进模拟盘。
我扒拉了一下,能整的活儿还挺全:
1️⃣ 一句指令无缝接入,OpenClaw、Claude Code、Cursor、Codex这些主流Agent全支持
2️⃣ 直接送你十万美金模拟资金,新手拿这个练手,亏了也不心疼
3️⃣ 看中哪位榜上大佬,一键跟单,自动复制他的操作
4️⃣ 股票、加密货币、外汇、期权,几乎所有主流市场通杀
人有人用的炒股软件,AI也该有AI玩的交易大厅。有兴趣的自己点进去研究:
🔗 https://github.com/HKUDS/AI-Trader
AI探索 | Hermes/OpenClaw|优质资源|优质信息
我觉得应该真正关注的是,谁能把更强大的AI放进普通人的电脑里。
Qwen 3.8-Max 下周开源。
更值得期待的是,Qwen 3.8-27B 也会一起开源。
旗舰模型当然重要,但对于绝大多数开发者来说,27B 才是真正能改变生产力的。
它既能在消费级硬件上部署,又有足够强的能力去做 Agent、知识库、代码、工作流等各种本地应用。
过去一年,一个很明显的趋势就是:
旗舰模型负责拉高能力上限,而 20B~30B 级别的模型,才是真正推动 AI 普及的主力。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
当下的格局大概是这样:
1️⃣ 英伟达遥遥领先,AMD紧追不舍
2️⃣ 谷歌TPU拿来训练Gemini,还要给Anthropic供货上百万颗
3️⃣ Groq的LPU直接被英伟达花200亿美金打包收走
说白了,谁能把数据更快送到算力面前,谁就是赢家。想搞懂这背后的门道,这篇值得你细读。
🔗 https://www.jacobpeake.com/ai-chip-architectures
AI探索 | Hermes/OpenClaw|优质资源|优质信息
国产AI大模型大搞恶意蒸馏,
一边拿国家财政算力补贴的钱给A/的Claude充值,
另一边用PPT诈骗地方政府产业基金的投资,
却全然不顾国防军工和国家安全机密在外网裸奔的恶劣后果。
这是党性不足,思想滑坡,吃里扒外,技术崇洋的表现。
国产大模型厂商是时候成立党支部了,刻不容缓。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
一边拿国家财政算力补贴的钱给A/的Claude充值,
另一边用PPT诈骗地方政府产业基金的投资,
却全然不顾国防军工和国家安全机密在外网裸奔的恶劣后果。
这是党性不足,思想滑坡,吃里扒外,技术崇洋的表现。
国产大模型厂商是时候成立党支部了,刻不容缓。
AI探索 | Hermes/OpenClaw|优质资源|优质信息