无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。
现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。
我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。
我没让它直接处理图片,我让它先让它看整张作业,把错、目区域、手写答案的位置直接输出成坐标。
后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的。
这就比单纯 OCR 有意思多了。
🔥当然,现在还远没到“干死作业 App”。
它坐标可能有偏差。
但以前这种东西,你得自己接 OCR、版面分析、错识别,甚至训练专用模型。
现在一个通用视觉模型,30 分钟就能先把整条链路跑通。
这里也有个很容易误解的地方:
视觉模型,不等于出图模型。
Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。
它本身不是 Image 2.5 那种负责生成像素的模型。
它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。
Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。
这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。
🔥再往前一步,这种模型甚至很适合当教师模型。
先让 Ling-3.0-flash-VL 批量看作业,生成错框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。
先让大模型直接干活,再让大模型教小模型干活。
这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。
OpenRouter现在可以免费使用Ling-3.0-flash-VL:
https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free
AI探索 | Hermes/OpenClaw|优质资源|优质信息
现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。
我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。
我没让它直接处理图片,我让它先让它看整张作业,把错、目区域、手写答案的位置直接输出成坐标。
后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的。
这就比单纯 OCR 有意思多了。
🔥当然,现在还远没到“干死作业 App”。
它坐标可能有偏差。
但以前这种东西,你得自己接 OCR、版面分析、错识别,甚至训练专用模型。
现在一个通用视觉模型,30 分钟就能先把整条链路跑通。
这里也有个很容易误解的地方:
视觉模型,不等于出图模型。
Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。
它本身不是 Image 2.5 那种负责生成像素的模型。
它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。
Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。
这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。
🔥再往前一步,这种模型甚至很适合当教师模型。
先让 Ling-3.0-flash-VL 批量看作业,生成错框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。
先让大模型直接干活,再让大模型教小模型干活。
这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。
OpenRouter现在可以免费使用Ling-3.0-flash-VL:
https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free
AI探索 | Hermes/OpenClaw|优质资源|优质信息