关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
不管什么新模型发布,其实我并不是很Care,因为它不管有多厉害,都很快就会被取代,不断会有“新王”上位!!
我觉得应该真正关注的是,谁能把更强大的AI放进普通人的电脑里。
Qwen 3.8-Max 下周开源。
更值得期待的是,Qwen 3.8-27B 也会一起开源。
旗舰模型当然重要,但对于绝大多数开发者来说,27B 才是真正能改变生产力的。
它既能在消费级硬件上部署,又有足够强的能力去做 Agent、知识库、代码、工作流等各种本地应用。
过去一年,一个很明显的趋势就是:
旗舰模型负责拉高能力上限,而 20B~30B 级别的模型,才是真正推动 AI 普及的主力。

AI探索 | Hermes/OpenClaw优质资源优质信息
调教豆包,教程过几天出
GPT生图也是迷,这种竟然是一次出,也没触发拦截

AI探索 | Hermes/OpenClaw优质资源优质信息
Next Token 现场录制中
@aigc1024
提到AI芯片,2018年两位图灵奖得主就放:计算机架构要迎来一场寒武纪大爆发。现在回头看,这真应验了——GPU、TPU、LPU、NPU各路架构全在抢AI的算力生意。
当下的格局大概是这样:
1️⃣ 英伟达遥遥领先,AMD紧追不舍
2️⃣ 谷歌TPU拿来训练Gemini,还要给Anthropic供货上百万颗
3️⃣ Groq的LPU直接被英伟达花200亿美金打包收走
说白了,谁能把数据更快送到算力面前,谁就是赢家。想搞懂这背后的门道,这篇值得你细读。
🔗 https://www.jacobpeake.com/ai-chip-architectures

AI探索 | Hermes/OpenClaw优质资源优质信息
到底是多好吃的杭州早餐
值得上海人排队半小时呢?
排队的人们都在议论着
@aigc1024
国产AI大模型大搞恶意蒸馏,
一边拿国家财政算力补贴的钱给A/的Claude充值,
另一边用PPT诈骗地方政府产业基金的投资,
却全然不顾国防军工和国家安全机密在外网裸奔的恶劣后果。
这是党性不足,思想滑坡,吃里扒外,技术崇洋的表现。
国产大模型厂商是时候成立党支部了,刻不容缓。

AI探索 | Hermes/OpenClaw优质资源优质信息
我现在用的最多的模型是:
Claude Fable 5
GPT 5.6 Sol
Claude Opus 4.6
Claude Opus 5
---
Opus 5 和 Sonnet 5 一样的毛病,过度思考,token 消耗很厉害,聪明不如 Fable 5,性价比不如 GPT 5.6 Sol,有点两头不沾,所以用的少,现在主要用在 Claude Design 相关任务。
Fable 5 虽然贵,但是结果相当靠谱,我会跟它一起讨论技术方案,或者复杂的任务。
其他的脏活累活则给 GPT 5.6 Sol,写作相关的还是 Opus 4.6 最好用。
昨天一个性能优化的任务,GPT 5.6 Sol 做了半天,最后给我悄悄把 16-bit 文本解码改成了 8-bit(图1),数字马上好看了,然后给我交差了😂
最后交给 Fable 5,虽然花了一些时间,但是找到问根源(图2),还打脸了 GPT 5.6 的优化,最后优化好了。

AI探索 | Hermes/OpenClaw优质资源优质信息
李笑来的新书《专注的真相》传达了一个基本认知:能够长期持续专注的人,无论做什么,都从根基上具备更强的竞争力。
有证据表明,注意力不足源自大脑的器质性损伤。看一眼四周,你一定不难得出“手机对大脑的劫持将愈演愈烈”这一结论。
阅读链接:https://pan.quark.cn/s/420f67a0f83e

@meiriyishu
官方整活!太有意思了!!
OpenAI搭了一个GPT-TV,也就是“AI直播电视台”!
有Live直播和Guide两个栏目,可以实时看 Astra 怎么干活,以及能干什么活!
官方介绍说,不知道Astra可以干什么,可以看看TV找灵感。
我进去看了一下Live,好像没有在工作,
应该是直播的工作人员还没上班,
毕竟那边现在已经是深夜了!

AI探索 | Hermes/OpenClaw优质资源优质信息
绝了!这应该是最适合接入视频剪辑工作流的AI!!
因为它真正能看懂视频,并且够快够便宜!
对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材!
好几个小时的素材,可能真正能用上的就几分钟!
而为了找到合适的,往往需要把每一条都从头看完,
根据脚本反复拖动时间轴、记录和剪切可用的素材。
这非常费时间,一点也不AI。
我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具,
能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容,
但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。
这次看到 新出的多模态模型 Ling-3.0-flash-VL,
MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。
激活参数更小,说明成本更低!
这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问!
第一时间测试了一下!!
我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点,
另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。
这已经不是单纯的“视频总结”之类的简单任务,
它需要按照时间线给出:
高光时间段+核心观点+入选理由+建议标+开头钩子+发布文案。
这应该才是多模态模型能够发挥价值的地方!!
普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用?
让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议!
完全就是一份可以照做的剪辑执行单!!
这说明和它对原视频的理解已经远超我的预估!!
我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸:
读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标和发布文案。
完全实现视频剪辑自动化!!
当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好,
时间码和上下文完整性也需要人工复核。
要想创作出好的视频作品,必然还是需要人的参与!
不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!

AI探索 | Hermes/OpenClaw
续集来了🤣
原来是一个人安静吃甜品,
现在给她加了个会喂到嘴边的人。
AI 的快乐,就是随时给故事续一集。好像很少看见双人的图片的,朋友视角的自然抓拍来玩一玩,来交作业~
GPT image2提示词:
竖版 3:4,单张真实手机生活抓拍照片,不要拼贴,不要四宫格,不要文字,不要水印。
仅参考上传图片中年轻成年亚洲女性的五官、脸型、黑色长直发、自然肤质和整体气质,保持女性外貌一致。重新构建甜品店双人互动场景,不照搬原图的单人姿势。
一对年轻成年亚洲男女坐在安静温馨的甜品店靠窗座位,两个人都清晰出现在画面中。女生坐在靠窗的浅棕色沙发椅上,穿浅灰棕色无袖针织长裙,黑色长直发自然披肩,身体微微面向男生,表情开心又略带害羞。
男生坐在女生旁边或斜对面,穿简洁干净的浅色短袖衬衫或白色T恤,黑色短发,外形自然清爽,不要明星脸,不要抢夺女生主体位置。男生一只手拿着甜品杯,另一只手拿着小勺,正自然地把一小口浅绿色冰淇淋递到女生嘴边。
女生微微前倾,轻轻张嘴准备吃下勺子里的冰淇淋,眼睛带笑地看向男生,或短暂看向镜头,呈现被朋友突然抓拍到的自然瞬间。男生侧头看着女生,表情温柔轻松,嘴角带自然笑意。两人的动作要有真实的互动关系,距离自然,不要僵硬摆拍。
桌面上可以放纸巾、另一杯甜品和一部手机,保留真实甜品店生活细节。背景是木质桌面、浅色墙壁、磨砂玻璃窗和暖棕色座椅,窗外透进柔和自然光,室内暖光与日光混合。
使用手机近距离拍摄,略带随手抓拍的构图,镜头与人物视线高度接近。女生为主要视觉焦点,男生完整露出脸部和上半身,两个人的手部、勺子和甜品杯关系清晰准确。真实皮肤纹理,轻微毛孔、自然碎发和真实衣服褶皱,不要过度磨皮。整体氛围轻松、甜蜜、生活化,像情侣约会时被朋友无意间拍下的一瞬间,但不要婚纱照或商业广告感。
不要只有男生的手入镜,不要男生被裁掉脸,不要第三个人,不要女生自己拿勺子,不要勺子悬空,不要勺子穿过嘴巴,不要手指畸形,不要多余手臂,不要共用一只手,不要五官变形,不要过度张嘴,不要夸张亲密动作,不要接吻,不要影楼摆拍感,不要假笑,不要塑料皮肤,不要过度磨皮,不要动漫感,不要背景杂乱,不要甜品杯文字乱码。

AI探索 | Hermes/OpenClaw优质资源|优质信息
你还在为找不到系统的大模型中文教材发愁?浙大团队刚开源了一本《大模型基础》,GitHub 上已经冲到 16K+ Stars,六章完整 PDF 直接免费下,不用花一分钱。
内容覆盖得挺全,从语言模型基础一路讲到 LLM 架构、Prompt 工程、参数高效微调、模型编辑和 RAG,每章还配了相关论文链接,想深入有现成路线可以顺着走。
最特别的是每章用不同动物当例子,把抽象概念讲得挺直观。项目还在持续更新,后续还要加推理加速和 AI Agent。
想入门的别犹豫,先存下来。
🔗 https://github.com/ZJU-LLMs/Foundations-of-LLMs

AI探索 | Hermes/OpenClaw优质资源优质信息
搞爬虫和自动化的兄弟注意了,有个叫Stealth Browser MCP的东西,专门给AI Agent用的隐身浏览器。
以前最烦的是啥?Cloudflare验证、各种反爬检测、登录墙,一顿卡你。这玩意直接开真实Chrome内核硬闯,测试里连Cloudflare和Queue-It那种排队验证都能过(当然看站点、地区、版本,不保证百分百)。
而且不是花架子,97个工具,从基础导航到直接跑CDP命令、克隆页面元素、抓网络请求全都有,嫌多还能砍到20个精简版。
想白嫖的自己去扒代码。
🔗 https://github.com/vibheksoni/stealth-browser-mcp

AI探索 | Hermes/OpenClaw优质资源优质信息
Back to Top