关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
AIGC 领域的最新工具、开源项目以及行业大事件
我觉得应该真正关注的是,谁能把更强大的AI放进普通人的电脑里。
Qwen 3.8-Max 下周开源。
更值得期待的是,Qwen 3.8-27B 也会一起开源。
旗舰模型当然重要,但对于绝大多数开发者来说,27B 才是真正能改变生产力的。
它既能在消费级硬件上部署,又有足够强的能力去做 Agent、知识库、代码、工作流等各种本地应用。
过去一年,一个很明显的趋势就是:
旗舰模型负责拉高能力上限,而 20B~30B 级别的模型,才是真正推动 AI 普及的主力。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
当下的格局大概是这样:
1️⃣ 英伟达遥遥领先,AMD紧追不舍
2️⃣ 谷歌TPU拿来训练Gemini,还要给Anthropic供货上百万颗
3️⃣ Groq的LPU直接被英伟达花200亿美金打包收走
说白了,谁能把数据更快送到算力面前,谁就是赢家。想搞懂这背后的门道,这篇值得你细读。
🔗 https://www.jacobpeake.com/ai-chip-architectures
AI探索 | Hermes/OpenClaw|优质资源|优质信息
国产AI大模型大搞恶意蒸馏,
一边拿国家财政算力补贴的钱给A/的Claude充值,
另一边用PPT诈骗地方政府产业基金的投资,
却全然不顾国防军工和国家安全机密在外网裸奔的恶劣后果。
这是党性不足,思想滑坡,吃里扒外,技术崇洋的表现。
国产大模型厂商是时候成立党支部了,刻不容缓。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
一边拿国家财政算力补贴的钱给A/的Claude充值,
另一边用PPT诈骗地方政府产业基金的投资,
却全然不顾国防军工和国家安全机密在外网裸奔的恶劣后果。
这是党性不足,思想滑坡,吃里扒外,技术崇洋的表现。
国产大模型厂商是时候成立党支部了,刻不容缓。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
有证据表明,注意力不足源自大脑的器质性损伤。看一眼四周,你一定不难得出“手机对大脑的劫持将愈演愈烈”这一结论。
阅读链接:https://pan.quark.cn/s/420f67a0f83e
@meiriyishu
官方整活!太有意思了!!
OpenAI搭了一个GPT-TV,也就是“AI直播电视台”!
有Live直播和Guide两个栏目,可以实时看 Astra 怎么干活,以及能干什么活!
官方介绍说,不知道Astra可以干什么,可以看看TV找灵感。
我进去看了一下Live,好像没有在工作,
应该是直播的工作人员还没上班,
毕竟那边现在已经是深夜了!
AI探索 | Hermes/OpenClaw|优质资源|优质信息
OpenAI搭了一个GPT-TV,也就是“AI直播电视台”!
有Live直播和Guide两个栏目,可以实时看 Astra 怎么干活,以及能干什么活!
官方介绍说,不知道Astra可以干什么,可以看看TV找灵感。
我进去看了一下Live,好像没有在工作,
应该是直播的工作人员还没上班,
毕竟那边现在已经是深夜了!
AI探索 | Hermes/OpenClaw|优质资源|优质信息
绝了!这应该是最适合接入视频剪辑工作流的AI!!
因为它真正能看懂视频,并且够快够便宜!
对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材!
好几个小时的素材,可能真正能用上的就几分钟!
而为了找到合适的,往往需要把每一条都从头看完,
根据脚本反复拖动时间轴、记录和剪切可用的素材。
这非常费时间,一点也不AI。
我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具,
能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容,
但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。
这次看到 新出的多模态模型 Ling-3.0-flash-VL,
MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。
激活参数更小,说明成本更低!
这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问!
第一时间测试了一下!!
我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点,
另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。
这已经不是单纯的“视频总结”之类的简单任务,
它需要按照时间线给出:
高光时间段+核心观点+入选理由+建议标+开头钩子+发布文案。
这应该才是多模态模型能够发挥价值的地方!!
普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用?
让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议!
完全就是一份可以照做的剪辑执行单!!
这说明和它对原视频的理解已经远超我的预估!!
我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸:
读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标和发布文案。
完全实现视频剪辑自动化!!
当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好,
时间码和上下文完整性也需要人工复核。
要想创作出好的视频作品,必然还是需要人的参与!
不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!
AI探索 | Hermes/OpenClaw
因为它真正能看懂视频,并且够快够便宜!
对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材!
好几个小时的素材,可能真正能用上的就几分钟!
而为了找到合适的,往往需要把每一条都从头看完,
根据脚本反复拖动时间轴、记录和剪切可用的素材。
这非常费时间,一点也不AI。
我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具,
能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容,
但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。
这次看到 新出的多模态模型 Ling-3.0-flash-VL,
MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。
激活参数更小,说明成本更低!
这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问!
第一时间测试了一下!!
我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点,
另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。
这已经不是单纯的“视频总结”之类的简单任务,
它需要按照时间线给出:
高光时间段+核心观点+入选理由+建议标+开头钩子+发布文案。
这应该才是多模态模型能够发挥价值的地方!!
普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用?
让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议!
完全就是一份可以照做的剪辑执行单!!
这说明和它对原视频的理解已经远超我的预估!!
我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸:
读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标和发布文案。
完全实现视频剪辑自动化!!
当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好,
时间码和上下文完整性也需要人工复核。
要想创作出好的视频作品,必然还是需要人的参与!
不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!
AI探索 | Hermes/OpenClaw
内容覆盖得挺全,从语言模型基础一路讲到 LLM 架构、Prompt 工程、参数高效微调、模型编辑和 RAG,每章还配了相关论文链接,想深入有现成路线可以顺着走。
最特别的是每章用不同动物当例子,把抽象概念讲得挺直观。项目还在持续更新,后续还要加推理加速和 AI Agent。
想入门的别犹豫,先存下来。
🔗 https://github.com/ZJU-LLMs/Foundations-of-LLMs
AI探索 | Hermes/OpenClaw|优质资源|优质信息
以前最烦的是啥?Cloudflare验证、各种反爬检测、登录墙,一顿卡你。这玩意直接开真实Chrome内核硬闯,测试里连Cloudflare和Queue-It那种排队验证都能过(当然看站点、地区、版本,不保证百分百)。
而且不是花架子,97个工具,从基础导航到直接跑CDP命令、克隆页面元素、抓网络请求全都有,嫌多还能砍到20个精简版。
想白嫖的自己去扒代码。
🔗 https://github.com/vibheksoni/stealth-browser-mcp
AI探索 | Hermes/OpenClaw|优质资源|优质信息