关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
🚨 重大新闻:ChatGPT 现在可以像专业摄影师一样编辑你的照片。里面最值得记住的是这几个原则:
① 先说你要什么结果是产品图、广告、信息图,还是人物照片?
② 描述画面中真正看得见的内容主体、构图、光线、材质、动作和相对位置,比“高级感”“电影感”更具体。
③ 需要准确文字时,把文字放进引号同时说明文字出现的位置、字体效果和次数,并要求不要生成额外文字。
④ 修改图片时,把“要改什么”和“不能改什么”分开写例如:只替换背景,保留人物、姿势、光线和产品外形。
⑤ 一次只调整一个问以上一张结果继续修改,同时重复必须保留的细节。
官方还提到,提示词不必迷信固定格式。短句、自然语言或结构化内容都可以,选择最方便检查和修改的写法即可。
如果你经常用 AI 生成或修改图片,这份指南很适合收藏。

AI探索 | Hermes/OpenClaw优质资源优质信息
大白天的,还是有点惊悚的。同时也不太知道意义在哪里。
@aigc1024
我操,太整活,太开放了!
小米 MiMo 团队居然在直播他们新模型 MiMo-V2.6 的RL 训练过程,看起来是一直在进行自动化的评估和测试。
然后一个特别的点是,它显示了成本,而且成本是实时显示的。
你可以看到训一个模型到底有多费钱,每一秒都在涨那个钱!
https://mimo.xiaomi.com/rl/
@aigc1024
再思考RSI
1.身份与连续性的承载单元从「进程/agent」上移到「环境」
2.环境供给必须便宜到「一人一个起」且长期跟随此人
3.记忆的 namespace 边界 = 社会单元
4.事件/trace 是自进化闭环的输入面,也是长资产
5.loop 内的实时输入分类与打断语义,与异步任务调度同权重
6.持久化状态机的递归形成的contract是胜负手
7.rsi上成长出来的设备会成为统一资源面承重,社会组织单元会在上面重新长出来
8.文件系统交换面会成为全双工语音之外的主要入口
9.除了全双工语音之外以上会在未来十二个月逐步发生
@aigc1024
推荐一个最近很火的开源项目 OfficeCLI,AI 办公这下真要变天了。
一句告诉 AI 你要什么,它就能直接生成 Word、Excel、PPT,写报告、做表格、整演示稿全包了。
更狠的是它自带渲染能力,AI 做完还能“看”一遍,发现排版问继续修改,形成生成→检查→修复的闭环。
https://github.com/iOfficeAI/OfficeCLI

AI探索 | Hermes/OpenClaw优质资源优质信息
其实有个象征性的事件
在这波 personal ai的浪潮里面,没有人在乎也没有人讨论背后是什么模型。
我觉得这就是一个标志性时间点,真正的价值从模型转到应用的时间点。
说得更明确一点,用户不在乎 geek不在乎 投资人不在乎 x根本没人讨论用的啥模型,但是都在讨论能干到啥。
@aigc1024
这是我见过
讲解 fde 现状最好的视频
没有之一!

AI探索 | Hermes/OpenClaw优质资源优质信息
Media is too big
VIEW IN TELEGRAM
卧槽,这我要做出来了,有人想玩吗?
有什么好的建议?

AI探索 | Hermes/OpenClaw优质资源优质信息
这你受得了吗
又打又亲的 成何体统😂
by Seedance 2.5 🎬

AI探索 | Hermes/OpenClaw优质资源优质信息
无人在乎,也不应该在乎,模型能力早已超出了人们99%的2C需求,如果不是100%的。
转发
: 其实有个象征性的事件
在这波 personal ai的浪潮里面,没有人在乎也没有人讨论背后是什么模型。
我觉得这就是一个标志性时间点,真正的价值从模型转到应用的时间点。
说得更明确一点,用户不在乎 geek不在乎 投资人不在乎 x根本没人讨论用的啥模型,但是都在讨论能干到啥。
@aigc1024
无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。
现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。
我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。
我没让它直接处理图片,我让它先让它看整张作业,把错、目区域、手写答案的位置直接输出成坐标。
后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的。
这就比单纯 OCR 有意思多了。
🔥当然,现在还远没到“干死作业 App”。
它坐标可能有偏差。
但以前这种东西,你得自己接 OCR、版面分析、错识别,甚至训练专用模型。
现在一个通用视觉模型,30 分钟就能先把整条链路跑通。
这里也有个很容易误解的地方:
视觉模型,不等于出图模型。
Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。
它本身不是 Image 2.5 那种负责生成像素的模型。
它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。
Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。
这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。
🔥再往前一步,这种模型甚至很适合当教师模型。
先让 Ling-3.0-flash-VL 批量看作业,生成错框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。
先让大模型直接干活,再让大模型教小模型干活。
这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。
OpenRouter现在可以免费使用Ling-3.0-flash-VL:
https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free

AI探索 | Hermes/OpenClaw优质资源优质信息
太搞笑了!!
一个新模型本来计划今天公布,结果发现大半个AI圈子都在讨论别人的前女友。
现在正在考虑延期公布!
顺便一提,这个新模型很有竞争力!!

AI探索 | Hermes/OpenClaw优质资源优质信息
《人生真相》:直面社会生存的人间清醒法则
撕开社会表面,直击生存底层逻辑:为什么资源永远向少数人倾斜?如何避开认知陷阱?如何在复杂人际中保护自己又不失底线?
没有鸡汤,只有冷峻真相和实用法则。读完它,你会第一次看清游戏规则,从被动挨打变成主动出牌。
点开这篇,狠狠清醒一次!
🔗https://pan.quark.cn/s/36ae5e3549b3

@meiriyishu
目前OpenAI 的亏损还在继续扩大;Anthropic 即使营收增长很快,利润率依然只有个位数。另一边,中国大模型还在不断把价格往下打,Kimi 这类低价 AI 产品只会让行业定价压力越来越大。
更关键的是,全世界绝大多数 AI 用户,本质上都是免费用户。AI 的使用量可以爆炸,但“使用量爆炸”不等于“利润爆炸”。用户越来越多,模型越来越强,价格却可能越来越便宜。
但与此同时,美股科技巨头已经为 AI 押上了数万亿美元级别的资本开支、债务和长期合同,其中相当一部分未来几年都已经锁死。也就是说,收入和利润还没有被证明,成本却已经先刚性化了。
按此趋势发展的,纳指未来5-7年里会被拖入长达至少数年的熊市中。

AI探索 | Hermes/OpenClaw优质资源优质信息
Anthropic 把 Claude 的后台任务模式 Cowork 和日常聊天合并成了一个入口,今天开始向 Pro 和 Max 用户逐步推送。
之前 Claude 有两个工作模式:聊天处理快问快答,Cowork 处理需要跑一阵子的大活儿——写报告、做调研、整理数据。问是用户经常拿不准一个任务该丢到哪边,而且两边的上下文不互通。现在不用选了,所有对都在同一个地方,Claude 自己判断任务需要什么能力。
同时上线的还有三个内容创作工具:Claude Docs(文档协作)、Claude Slides(幻灯片)和 Claude Design(设计,之前是独立产品,现在也嵌进了对)。在聊天里说一句"帮我写个周报",Claude 直接生成文档,你可以在里面改、加批注、让 Claude 继续调整;说"做五页幻灯片给领导汇报",slides 就出来了,改完可以直接下载成 PowerPoint 或 PDF。文档和幻灯片共享同一个对上下文,所以内容天然一致,不用来回复制粘贴。
实际使用场景大概是这样:出门前让 Claude 查上周项目进展、写周报、顺便做个汇报用的幻灯片,路上用手机看进度,到办公室直接改两笔就能发。还能设成定时任务,比如每周一自动开始写周报。Claude 默认每一步都会征求你确认,如果嫌烦也可以切成"有问再找我"模式。
三个创作工具目前都是 beta 状态,面向付费用户开放,企业版由管理员决定何时开启。Cowork 老用户不受影响,之前的对、项目、连接器都还在。Team 和免费用户后续跟进,企业用户会提前 30 天收到通知。
https://claude.com/blog/cowork-is-now-claude

AI探索 | Hermes/OpenClaw优质资源优质信息
Media is too big
VIEW IN TELEGRAM
测不了,信号太弱。纯事实性内容(比如“牛顿最著名的著作叫《自然哲学的数学原理》……”)水印也没什么发挥空间,因为下一个词几乎没有选择余地。你让 Claude 校对一篇文章只改语法标点,大部分词还是你的,水印可能根本不够形成可检测的信号。
轻度编辑大概率不会完全去掉水印。但如果把每个词都换一遍,水印就没了,当然到这个程度,这段文字算不算 AI 生成的本身也值得商榷了。
至于为什么全球统一加水印而不只在欧盟范围内执行,Anthropic 给出的理由是他们目前没有一个可靠的方式按地区区分是否施加水印。所以干脆全球统一上线,后续再评估是否调整。
检测端还没有完全就位。Anthropic 表示很快会推出水印检测 API,但具体时间和使用方式还在敲定中。这也呼应了 Alex Cui 之前提到的一个关键问:检测器是公开还是内部使用,会直接影响水印的实际安全性。
顺便说一下,签署这份欧盟透明度行为准则的不止 Anthropic 一家,总共有大约 190 个签署方。水印不是 Claude 独有的事情,其他大模型厂商也会陆续跟上各自的方案。

AI探索 | Hermes/OpenClaw优质资源优质信息
Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。
Claude 用的是 Google DeepMind 2024 年发表在《Nature》上的 SynthID-Text 方案,往上追溯可以到 Scott Aaronson 2022 年的提案。这一脉方案的共同特征是在模型选词时,用密钥改变随机数的来源,从而在输出中留下统计痕迹。
Anthropic 举了个例子帮助理解。假设模型写到“今天天气很冷,而且……”,下一个词可能是“阴沉”,也可能是“灰蒙蒙的”,对读者来说意思差不多。正常情况下,模型用一个随机数在这些候选词里选一个。加了水印之后,选词过程还是随机的,但随机数的来源变了,变成由密钥和前面的词共同决定。文本读起来完全一样,但事后拿着密钥去核对选词序列,就能算出这段是 Claude 写的概率。
Anthropic 在文中特别强调了一点:水印不会让模型选它本来不会选的词。模型不会因为水印而突然用一个生僻词(文中举的例子是 nubilous,一个几乎没人用的“阴天”的同义词)。水印只在模型本就犹豫的那些选择上起作用。
然后是大家最关心的:会不会降低输出质量?
Anthropic 说他们内部测试没有观察到水印对内容质量、创意水平或可读性的影响。他们援引了 Google DeepMind 的数据作为佐证:Google 在 Gemini 的实际流量中给一部分用户提供了带水印的模型,对比用户的点赞点踩反馈,两组没有统计显著差异。同时在受控实验中,人类评估者把带水印和不带水印的回答放在一起对比,也看不出区别。
打个比方:想象你在玩大富翁,本来每回合掷骰子决定走几步。现在改成查圆周率的小数位来决定,从某一位开始,依次读下去。对玩家来说,每一步还是随机的,游戏体验没有变化。但如果有人事后看走步的完整序列,再对照圆周率,就能判断这盘游戏用的是圆周率而不是骰子。
关于代码,Anthropic 的解释是:水印只在选哪个词都行的地方起作用。代码大量地方必须精确,“2+2=”后面只能跟 4,水印无从施加。所以代码的水印密度天然就比自然语言低。不过在代码注释、变量命名这些有选择余地的地方,水印仍然可以嵌入。
还有一个之前没怎么讨论的重要信息:水印不携带任何用户身份信息。不能追溯到具体的用户、组织或对。水印只回答一个问,“这段文字是否可能经过 Claude 处理”,仅此而已。
文章中也提到了水印的局限。短文本检
Back to Top