乐于分享
好东西不私藏

我用 AI 花一小时做了个抖音转文字工具,把全过程拆给你看

我用 AI 花一小时做了个抖音转文字工具,把全过程拆给你看

刷到一条干货口播,想存成文字反复看。

收藏等于吃灰,手动打字打到手酸,网上的转写工具要么收费,要么断句烂、要么加水印。

这种破需求,我没自己写一行代码。打开 WorkBuddy,挂了两个抖音技能,把需求一说,一小时后工具跑起来了:粘贴链接,十几秒,一整篇带分段的文字稿就出来,能复制能下载,不登录、不收费。

这篇不空谈,我把从找技能、提需求、遇到报错、到迭代改 UI、再到接上 AI 和飞书 的全过程,按我自己的操作步骤原原本本拆给你看。你照着做,要么直接用上工具,要么学会怎么让 AI 帮你造一个。

第一步:先找对"技能",别让 AI 凭空干

很多人用 AI 做东西做不成,是因为一上来就让它"给我做个 XX",它脑子里没这个领域的东西,只能瞎编。

WorkBuddy 里有个地方叫 SkillHub(技能中心),别人把"怎么干某件事"的完整流程封装成了技能,你挂上它,AI 就等于提前学会了这门手艺。

我是这么找的:

在 SkillHub 搜索"抖音",选用下载器和转文字两个技能

四个动作:

1、点左下角(或顶部)的 「专家·技能·连接器」

2、搜索框直接搜 「抖音」

3、进入 SkillHub

4、把 「抖音下载器」「抖音视频转文字」这两个技能选用上

为什么是这两个?一个负责把抖音视频的真实地址、字幕、信息抓下来,一个负责把没有字幕的视频用语音识别转成文字。两个一配,抖音转文字这件事的底层能力就齐了。

这一步的关键:先备料,再开工。你让 AI 干一件它不熟悉的事之前,先去技能中心搜一圈,有没有现成的能力可以挂。这能省掉后面一半的坑。

第二步:把需求一次说清楚,让它去做

技能挂好后,就回到对话框,把你要的东西像给外包提需求一样写清楚。

我当时是这么发的(这段话你可以直接抄去改):

请开发一个网站,用户粘贴抖音视频链接后,自动提取完整文字稿并展示。要包含链接输入区、提交按钮、结果展示区;校验链接格式;提取中显示加载状态;失败给清晰错误提示;结果按时间分段显示;提供一键复制和下载 txt;界面简洁、响应式适配手机;不需要登录;确保文字稿完整,不遗漏字幕或正文。

注意我没有说"用什么技术栈""几个文件",我只说我要什么效果。技术选型让它自己定。

挂载技能后发送需求,AI 自动完成开发并启动服务

然后它就开始干了:建项目、写后端抓取、写前端页面、装依赖、启动服务。大概一个小时,给我回了一句:

抖音文字稿提取网站已完成,已在 http://localhost:3000 运行

浏览器打开,真能用。链接粘进去,文字稿就出来了。

很多人卡在这一步,是因为需求太模糊("帮我做个转文字的"),AI 只能猜。你把"要有什么、不要什么、失败了怎么办"讲明白,它交付的东西天差地别。

第三步:别它说"成功了"你就信,逐项验收

AI 最擅长的事之一,就是自信地告诉你它做完了,但细节里全是窟窿。所以它交付后,我没急着高兴,而是对着自己当初的需求一条条对。

功能对照表,以及开发中解决的两个关键技术问题

这是它给我的实现对照,我一条条验:

✅ 链接输入、格式校验、加载状态、错误提示

✅ 按时间分段、一键复制、下载 txt

✅ 响应式、免登录

功能确实都在。但真正有含金量的,是它在做的过程中自己撞上来、又解决掉的一个硬骨头,这才是这类工具能不能跑通的命门:

抖音反爬。直接请求电脑版抖音页面,拿到的是个空壳——电脑版是单页应用,内容全靠浏览器加载完再用 JS 填进去,程序去抓只能抓个架子,旧接口也早废了。最后是换成请求手机版分享页,服务器把数据直接渲染在页面里,一次就通。

这一步我想强调的是:AI 给你的不是成品,是"待验收的初稿"。
你要做的不是替它写代码,而是对着需求逐条验,在它卡住的地方知道该往哪推。它说"成功了",你得自己点一遍。

第四步:一定会报错,把它当成调试搭档

工具跑起来,我兴冲冲拿了条七分多钟的视频去测——结果翻车了,页面提示"网络异常或服务不可用"。

报错排查:不是提取逻辑问题,而是后台进程退出了

要是以前我可能就放弃了。但这次我把报错截图直接丢回给它,让它查。

查出来的真相有点反直觉:不是提取逻辑有问题。我把那条视频单独跑了一遍,识别其实是成功的——448 秒的视频,转出 256 段、2198 个字,耗时 12.3 秒

真正的原因是:服务进程跟着启动它的会话一起退出了,所以第二次请求时后台已经没人了。

于是我让它做了两件事:

1、给服务加进程级错误捕获,单个请求出错不再拖垮整个服务;

2、做了一个 「启动服务.bat」,双击在独立黑窗口里运行,窗口不关,服务就一直在。

修完再测,稳了。

这一步是大多数人用 AI 做东西的分水岭。
报错不可怕,可怕的是一报错就觉得"这工具不行"。你要做的是把错误信息原样喂回去,让它定位、让它修,你负责判断它说的原因对不对。它是个手很快但偶尔不靠谱的搭档,不是一锤子买卖的外包。

第五步:接着提需求,让它越用越顺手

能用之后,我又提了两个真实使用中冒出来的需求。

第一个:我要一份不带时间戳的纯净稿。

它默认给的是"[00:12] 某某某"这种带时间的分段,我想把稿子整段复制走发人、存档,带时间戳太脏。于是我跟它说:"我还要一份完整的文字稿,复制的时候没有时间。"

它就加了一块纯净文字稿区,按句子自动合并成自然段,并多了三个按钮:

复制文字稿:纯净正文,不带任何时间戳

下载 .txt:存成本地文件

复制(含时间戳):需要对时间点的时候用

第二个:UI 被按钮撑坏了。

第一次改版后,三个按钮挤一行,后面两个按钮的字被挤成了竖排。我截了个图圈出来发给它,它立刻把布局改成:主按钮独占一整行,两个次要按钮各占一半,加了不换行规则,手机上还会自动纵向堆叠。

增加无时间戳纯净稿,三个按钮布局重新调整

你看,从"能用"到"好用",就是这样一轮一轮喂需求喂出来的。别想着一次到位,先用起来,哪里不爽改哪里。

第六步:从一个页面,长成一个工作台

工具用了几天,新的麻烦冒出来了:我转了十几条视频,结果全堆在一个页面里,想找回之前那条得翻半天;有时候想一次性丢五六个链接进去,也只能一条一条粘。

我跟它说:"我要一个侧边栏,分成单条转写、批量转写、文案库三个入口。转写过的东西自动存进文案库,随时能搜、能看、能再加工。"

没一会儿,整个界面换成了左右分栏的工作台:

左侧侧边栏三视图:单条转写、批量转写、文案库

左边是三个导航,右边是对应视图,互不干扰。

单条转写保持原来最轻的样子——粘链接、出结果、复制下载。但结果区下方多了一排 AI 智能加工入口(后面第七步细讲),还多了一个"上传到飞书"按钮。

批量转写是我这次最想要的:把多个抖音链接(或者整段分享文案)一次粘进去,每行一个,它自动排队处理,每条的状态实时刷新——排队中、识别中、已完成、失败,一目了然。转完全部自动入库,不用手动存。

一次粘贴多个链接,自动排队处理并入库

文案库就是本地的素材池。所有转写过的视频按卡片排列,显示标题、作者、时长、字数和正文预览,顶部有搜索框,输关键词即时过滤。每条卡片下方有两个按钮:"AI 加工"和"上传飞书",卡片底部还会显示这条记录已经做过哪些 AI 分析,以及飞书上传状态。

转写记录卡片化,支持搜索、AI 加工、上传飞书

到这一步,它已经不是一个"转写页面"了,是一个素材处理工作台。转写只是入口,后面的加工、管理、归档才是真正花时间的地方。工具不要追求一步到位,但要让它跟着你的使用痕迹长。

第七步:AI 不止能转写,还能帮你想

转写解决的是"把视频变成字",但真正费脑子的是后面——这条视频哪里值得抄?结构是什么样的?戳了什么痛点?能改写成什么选题?

以前这些全靠我自己边看边记。现在我让 AI 在工具里直接干。

在任何一条转写结果上点"AI 加工",右侧会滑出一个抽屉,六个动作排两列:

六个 AI 动作:金句、结构、痛点、选题、小红书、公众号

六个动作分别干这些事:

提炼金句:把整条视频里最有传播力的句子挑出来,直接能当文案素材

拆解爆款结构:从开头钩子、核心观点、论证方式、情绪节奏、结尾引导,一层一层拆开,告诉你它为什么让人看得完

挖掘痛点:列出这条视频戳中的痛点清单,标出"最痛的那一个",并给出切入角度

选题建议:基于这条视频的主题,生成 8-12 个可延展的选题,再推荐 3 个最值得做的

小红书笔记:直接改写成小红书风格的笔记草稿

公众号大纲:生成公众号文章的结构大纲

比如拆解结构,它给出的不是泛泛而谈,而是按【开头钩子】【核心观点】【论证方式】【情绪节奏】【结尾引导】【可复用点】六个标签逐项输出:

按标签逐项拆解爆款结构,可直接复用

这些分析结果会自动保存在那条记录里,下次打开还在。你做了几个动作,文案库卡片上就亮几个标签,不会丢。

AI 这一层我做成了可插拔的。默认用内置的 Groq 大模型(免费额度,开箱即用),如果你有自己的 OpenAI 兼容接口——公司内部模型、第三方兼容 API——在设置里填一下 API 地址、密钥和模型名,所有 AI 动作就全部走你自己的模型。

支持自定义 OpenAI 兼容接口,不填则用内置免费模型

这一步我最大的感受:AI 工具的价值不在"生成",在"接住你的下游"。
转写只是把素材搬进门,真正省时间的是后面那些"看完之后要动脑"的环节。你让 AI 把这些环节也包了,工具就从"录制笔"变成了"策划助理"。

第八步:让文案自动飞进飞书多维表格

最后一块拼图,是归档。

我自己在用飞书多维表格管素材库——每条视频对应一行,字段包括标题、链接、作者、文案原文、金句、结构拆解、痛点、选题建议、我的启发……一共二十多个字段。以前转写完,得手动复制粘贴到每一列,一条视频折腾五六分钟。

我跟它说:"给我接飞书。我填 app_id、app_secret 和多维表格链接,你自动鉴权连上;表里缺什么字段你自动建;文案库里每条记录旁边放一个按钮,点一下就按字段映射写进去,AI 分析结果也一起带过去。"

连接只需要三个东西:飞书应用的 App ID、App Secret,以及多维表格的链接(Base 链接和知识库链接都支持,自动解析)。

填入 App ID、Secret 和表格链接,一键测试连接(敏感信息已打码)

填完点"测试连接",它会自动鉴权、解析出 app_token / table_id / view_id、拉取现有字段列表。知识库链接会先调 wiki 接口换成 bitable 的 app_token,再去连表。

字段映射是可视化的。设置里"字段映射"标签页,左边是工具内部字段名,右边是飞书表里对应的列名,想改哪列直接改输入框。

内部字段与飞书列名一一对应,可自由修改

点"同步字段"时,它会对比映射表和飞书现有列:缺的自动建,重复的标记出来让你选删哪个,已有的不动。而且是"类型感知"的——文本列写文本、数字列写数字、日期列写毫秒时间戳、超链接列写链接对象,不会把日期写成字符串。

文案库里每条卡片有"上传飞书"按钮,点一下整条记录(原文 + 六个 AI 分析结果)就按映射写进飞书。成功后按钮变"已上传"并显示记录 ID。顶部还有"上传全部到飞书"批量入库。

更细的处理:AI 返回的结构分析是一整段文本,但飞书表里"开头钩子""核心观点""可复用点"是分开的三列。写入时自动用正则把【开头钩子】【核心观点】【可复用点】拆出来分别填入——不是一坨文本扔进去完事。

这是我实际上传后的飞书多维表格,序号、视频标题、视频链接、作者、文案原文、开头钩子、核心痛点、解决方案、情绪曲线……每一列都按字段映射自动填好了:

上传后飞书多维表格中的素材记录,各字段自动填入

至此整个链路闭合了:

抖音链接 → 文字稿 → AI 加工(金句 / 结构 / 痛点 / 选题)→ 一键写入飞书素材库

从"看到一条好视频"到"素材进库、分析到位",以前至少二十分钟的手工活,现在两三分钟。

你想直接用?照着这几步来

如果你不想走一遍制作过程,只想把工具用起来,照着下面做。

准备两样东西:

1、Node.js:去 nodejs.org 下载 LTS 版本装好,命令行输 node -v 能看到版本号即可。

2、ffmpeg:Windows 去 gyan.dev 下载 full 版本,解压后把 bin 目录加到系统环境变量 PATH。

💡 语音识别和 AI 加工用的 Key 项目里已经内置了,开箱即用,你不用自己申请。想用自己的额度或其他 OpenAI 兼容模型,在设置的"AI 模型"里填 API 地址、密钥和模型名即可。飞书联动是可选的,不用也完全不影响转写和 AI 加工。

然后:

1、下载源码 👉 github.com/Zorianchen/douyin-transcribe,解压到本地文件夹。

2、文件夹地址栏输 cmd 回车,运行 npm install

3、双击 「启动服务.bat」,看到本地地址就成了。

4、浏览器打开,把抖音链接(甚至整段分享文案)粘进去,它会自动识别链接,点「提取文字稿」。

粘贴整段分享文案,自动识别出抖音链接

等十几秒,结果就出来了:上面是按时间分段的稿子,下面是一份不带任何时间戳的完整文字稿,三个按钮各管一摊——复制纯净稿、下载 txt、复制带时间戳版本。

无时间戳完整文字稿,一键复制或下载

转写完的记录会自动进文案库,想做 AI 加工就点卡片上的"AI 加工",想归档飞书就点"上传飞书"。整个过程不登录、不上传你的数据到第三方,视频和临时文件都在你自己电脑上处理。

最后

说实话,这工具核心代码也就几百行,不算多复杂。

但做下来我最大的感受是:现在用 AI 造东西,难的早就不是写代码了。你把需求一说,它几秒能给你生成一大堆。真正难的是三件事——

找对能力先挂技能,别让它凭空干

说得清楚把要什么、不要什么讲明白

验得出来、修得下去它说成功你别全信,报错了你别放弃

它像一个手很快但不太靠谱的实习生。你要做的从来不是替它干活,而是当那个会验收、会纠偏、会在它卡住时推一把的人。

第一版只是起点。真正让工具变得值钱的,是你用着用着冒出来的那些"要是能再多一步就好了"——想要批量、想要 AI 帮你想、想要自动归档到飞书。每一个这种念头,丢回给它,都是下一轮迭代。

源码和启动脚本都放 GitHub 了(github.com/Zorianchen/douyin-transcribe),想用的直接拿走,想改成自己版本的随便折腾。

有问题留言区聊 👇