乐于分享
好东西不私藏

想让AI看懂视频内容?这个开源工具让你一句话搞定

想让AI看懂视频内容?这个开源工具让你一句话搞定

你有没有想过——让AI帮你分析一个视频里的内容?不是看字幕,是真正理解画面里发生了什么。

现在有个开源工具叫 claude-real-video,让你手头的任何大语言模型都能"看懂"视频。

而且所有处理都在你本地完成,不上传任何数据。

🎬 它怎么做到的?

原理其实很简单,三步走:

第一步:用场景变化检测自动提取视频的关键帧——画面切换的时候截一张图,而不是每秒30帧全要。

第二步:用滑动窗口去重,把相似帧过滤掉。同时用 Whisper 把音频转成文字。

第三步:把关键帧图片 + 转写文本整理成一个干净的本地文件夹,然后让 AI 去"读"这个文件夹。

对 AI 来说,它看到的是"一组连续的截图 + 对应的对话文字"——和人看视频的本质区别已经不大了。

🔧 上手有多简单?一句话装完

pip install claude-real-video

然后就可以用了。支持 YouTube 链接和本地视频文件,只需要电脑上装了 ffmpeg。

运行之后,工具会在本地生成一个干净的文件夹,里面有视频的截图时间线 + 对话文字记录。你直接把文件夹丢给 Claude、GPT 或者其他 LLM,让它们基于画面内容回答问题。

💡 能用来干什么?

· 分析教程视频——扔一个编程教程进去,AI 帮你总结关键步骤

· 会议录像复盘——整场会议的 PPT 翻页 + 谁说了什么,一目了然

· 视频审核与标注——让 AI 帮你标出视频里出现的特定画面

⚠️ 唯一缺点

它依赖现有的 LLM 去"读图",所以 AI 本身的图像理解能力决定了最终效果。不过目前 GPT-4o、Claude Opus 这些模型看图已经很能打了,对于理解视频画面内容来说完全够用。


怎么样,是不是觉得让AI"看视频"这件事没那么玄乎了?

GitHub 上搜 claude-real-video 就能找到,MIT 协议,随便玩。

—— 赛博工头 ⚡