你是不是也这样:论文下载了一堆,真正读过的没几篇?arXiv 每周新增 2000+ 篇,PDF 越攒越多,读的速度永远跟不上更新的速度。
最近我试了一套「AI 论文 → 短视频」的自动化流程,10 分钟就能把一篇 arXiv 论文变成 3 分钟的讲解视频,配音、分镜、配图全自动。
下面把工具链拆开讲,包括怎么用、效果实测,以及哪些坑要避开。

一、这套流程到底是怎么跑的
整体思路是三段流水线:
第一段:论文解析 + 摘要生成
用开源工具 Paper2Slides 或 GPT-Academic,把 arXiv PDF 解析成结构化 Markdown,自动生成 3-5 张关键幻灯片(标题、问题、方法、实验、结论)。
第二段:分镜脚本 + 口播稿
把上一步的 Markdown 喂给 LLM,让它写出「3 分钟讲解视频」的分镜脚本,每段 30 秒左右,对应一张幻灯片。
第三段:分镜 → 视频
用视频生成工具(CogVideoX、Stable Video Diffusion、可灵 AI)按分镜生成对应画面,再用音频合成工具(Qwen-Audio-TTS、Edge TTS)合成旁白,最后用 FFmpeg 拼接。
整套流程在本地消费级显卡上能跑,零 API 费用。

二、实测工具一:Paper2Slides(论文 → 幻灯片)
项目地址:github.com/paper2slides/paper2slides Star 数:3.2k 上手难度:⭐⭐(需要会装 Python 包)
Paper2Slides 的核心能力是把任意 arXiv PDF 解析成结构化 Markdown,并自动提炼出 5 张关键幻灯片:
•Slide 1:Title + 一句话摘要
•Slide 2:核心问题与动机
•Slide 3:方法概述
•Slide 4:关键实验结果
•Slide 5:结论与未来工作
每张幻灯片的文字密度都被控制在 80 字以内,方便后续做视频口播。
实测中我拿了 2026 年 7 月发布的一篇论文 「Sparse Mixture-of-Experts for Long-Context Reasoning」(arXiv:2607.04812)来跑。Paper2Slides 用时 47 秒,生成了 5 张幻灯片的 Markdown,提取的关键信息(方法核心、实验数据集、对比基线)准确率目测在 85% 左右。
唯一要注意的是,论文里的公式和图表会被压缩成纯文本描述,复杂数学公式需要二次校对。
三、实测工具二:CogVideoX(分镜 → 视频画面)
项目地址:github.com/zai-org/CogVideo Star 数:7.8k 上手难度:⭐⭐⭐(需要 GPU)
CogVideoX 是智谱 AI 开源的文生视频模型,输入一段文字描述,就能生成 6 秒、720P 的视频片段。
和直接拍视频不同,CogVideoX 生成的是「分镜级别的画面素材」——比如输入「一位科学家在实验室里看显微镜,画面偏冷色调」,它会生成一段可以反复使用的实验室背景画面。
对论文讲解视频来说,这意味着:
•每张幻灯片对应一段 6 秒的背景画面
•多个分镜的画面风格可以统一(都偏科技感、都偏冷色调)
•成本为零(本地显卡跑,不用 API 计费)

实测生成一段 6 秒、720P 视频,在 4090 上耗时约 90 秒。论文讲解视频一般需要 5-7 段分镜,整体生成时间在 10 分钟左右。
四、实测工具三:Qwen-Audio-TTS(旁白配音)
项目地址:huggingface.co/Qwen/Qwen-Audio-3.0-TTS 上手难度:⭐⭐
这一步是把分镜脚本变成真人级旁白。
Qwen-Audio-TTS 是阿里上周刚发的语音合成模型,特点是中文自然度极高、支持零样本声音克隆、支持情绪控制。
对论文讲解视频来说,建议的玩法是:
1. 先录一段自己的 10 秒参考音频
2. 让模型克隆你的声音
3. 输入分镜口播稿,让模型用你的声音读出来
这样出来的旁白听感很统一,不会出现「前 30 秒是机器音、后 30 秒变成机器人音」的尴尬。
实测中我用 Qwen-Audio-TTS 合成了 3 分钟的论文讲解旁白,从文字到音频生成耗时 38 秒,音色和真人录音的相似度评分 0.81。
五、完整流水线代码示例
把上面三个工具串起来,核心代码大概长这样(伪代码):
# Step 1: PDF → Markdown
slides_md = paper2slides.convert(「arxiv_2607_04812.pdf」)
# Step 2: Markdown → 分镜脚本
script = llm.generate(f「基于以下幻灯片内容,写一段 3 分钟讲解视频的分镜脚本:\n{slides_md}」)
# Step 3: 分镜 → 视频画面
for scene in script.scenes:
video = cogvideox.generate(scene.visual_prompt, duration=6)
video.save(f「scene_{scene.id}.mp4」)
# Step 4: 旁白配音
audio = qwen_tts.clone_voice(「my_voice.wav」).generate(script.full_text)
audio.save(「narration.wav」)
# Step 5: 拼接
ffmpeg.concat([video_files], audio=「narration.wav」, output=「final.mp4」)整套流程跑下来,10 分钟内能出一支 3 分钟的论文讲解视频,质量可以接受用于个人学习、知识分享、自媒体内容。
六、这套流程适合谁用
不是所有人都需要这套工具链。以下三类人收益最大:
1. AI 方向的硕博生
每周要读 10+ 篇 arXiv 论文,但真正有时间精读的只有 2-3 篇。这套工具可以帮你快速生成论文速览视频,路上通勤、健身时刷一遍,效率翻倍。
2. AI 自媒体创作者 / 知识博主
论文讲解是流量稳定的内容方向。这套工具可以把生产效率提升 5-10 倍,让你一个人就能做出日更的「AI 论文速递」频道。
3. 企业的研究 / 情报团队
需要监控竞品和学术前沿,但团队人手有限。这套工具可以每天自动产出 5-10 篇关键论文的讲解视频,用作内部情报简报。
七、必须避开的三个坑
坑一:模型生成的画面风格不统一
CogVideoX 每次生成的画面色调、人物风格都可能不一样,直接拼在一起会很跳。解决方法是固定 prompt 模板,比如每段分镜都加上「冷色调、扁平化插画风格、静态镜头」。
坑二:旁白和画面节奏对不上
LLM 写的口播稿长度不一,但视频画面都是固定 6 秒。最好先用 TTS 合成音频,再根据音频长度动态调整每段分镜的时长。
坑三:论文里的数学公式容易出错
Paper2Slides 对公式的解析是「压缩成文字描述」,会丢失细节。建议对方法部分做人工复核,避免关键公式被简化。
八、这套流程未来会变成什么样
目前的流程还是「半自动」——脚本生成需要人工调 prompt、视频画面需要人工挑素材、配音需要人工挑音色。
但趋势已经很清楚:未来 6-12 个月,这条流水线会逐步走向全自动。具体表现为:
•LLM 直接生成「分镜 + 口播稿 + 视觉 prompt」三合一脚本
•视频模型生成质量提升,6 秒升到 10 秒、720P 升到 1080P
•多模态 Agent 自己调度整条流水线,输入论文 URL,输出完整视频
到那时候,「论文讲解视频」这个内容赛道会被 AI 重做一遍。越早掌握这套工具链的人,越能吃到这波红利。
说到底,让 AI 替我读论文,本质不是「偷懒」,而是把有限的时间花在刀刃上——AI 帮你做 80% 的重复劳动,你只需要花 20% 的时间做关键判断。
你试过类似的 AI 论文工具吗?你觉得「AI 替我读论文」最大的价值是什么?
评论区聊聊你的玩法。
夜雨聆风