AI工具 Skill技能库 关于道场

视频语音转文字工具:抖音/B站/YouTube链接一键提取中文字幕

一人堂 |2026-09-30

输入视频链接,自动完成下载、语音识别、文字转写,输出带时间轴和纯文字两版中文稿。支持抖音、B站(B23.tv/BV号)、YouTube(youtu.be)、快手等主流平台。提供分段处理策略应对长视频,自动校正同音错字。零配置,复制SKILL.md即可在Claude Code/Cursor/OpenClaw等Agent工具中使用。

视频语音转文字工具:抖音/B站/YouTube链接一键提取中文字幕

【适用场景】

- 自媒体创作者:将视频内容快速转写成文字稿,用于公众号/小红书/微博图文内容二次创作 - 内容策划:提取竞品/标杆视频的完整文案,进行爆款结构分析和标题拆解 - 知识博主:将播客、教程视频转文字,整理成可阅读的图文笔记 - 运营人员:提取直播间/带货视频的核心话术和产品卖点

【操作步骤】

步骤1:提供视频链接

用户给出抖音、B站、YouTube、快手等平台的视频链接,说出「提取视频内容」「视频转文字」「语音转字幕」等意图时,直接调用本技能。

步骤2:自动下载与格式识别

技能自动识别平台类型,选择最优下载方式:

站点链接形式下载方式
抖音v.douyin.com 短链 / douyin.com/video/IDyt-dlp失败后自动回退无头Chromium捕获直链
B站b23.tv 短链 / BV号yt-dlp直接下载
YouTubeyoutu.be / youtube.com/watchyt-dlp直接下载
快手、其他短链或长链yt-dlp优先,失败后Chromium回退

步骤3:音频提取与转写

1. 用yt-dlp提取音频(抖音类站点需要新鲜Cookie,失败时自动切换Chromium捕获) 2. 用imageio-ffmpeg完整版ffmpeg转成16kHz单声道WAV格式 3. 调用faster-whisper(small模型,CPU int8推理)进行中文语音识别 4. VAD过滤静音,输出带时间轴文字稿

步骤4:长视频分段处理

音频超过8分钟时自动启用分段策略: - 按6-7分钟切段,段间保留10秒重叠 - 逐段调用faster-whisper,时间戳加段偏移量 - 合并时丢弃重叠部分,再做术语校正

步骤5:后处理与交付

- 结合视频标题和上下文语义,校正同音错字(如「运有变数」需结合内容判断是否应为「孕有变数」) - 国学、方言、专业术语(DeFi、NFT等)按上下文自动校正 - 输出两版:文字稿.txt(纯文字)和meta.json(含标题、站点、时间轴信息) - 全程中文回复用户

【代码模板】

命令行调用

```bash python <skill目录>/scripts/video_to_text.py "<视频链接>" [输出目录] [--model small] [--keep-media] ```

参数说明: - `视频链接`:必填,支持抖音/B站/YouTube/快手等平台 - `输出目录`:选填,默认为当前目录 - `--model`:选填,可选`base`(快速)/ `small`(默认,推荐)/ `medium`(高精度) - `--keep-media`:选填,保留下载的音视频中间文件(默认转写后清理)

依赖安装

```bash pip install requests imageio-ffmpeg faster-whisper yt-dlp playwright python -m playwright install chromium # 仅抖音类站点需要 ```

首次环境验证

```bash python -c "import requests, imageio_ffmpeg, faster_whisper, yt_dlp, playwright" ```

【复盘要点】

1. 抖音链接处理:yt-dlp需要新鲜Cookie,直接下载会失败。技能自动回退到Chromium捕获模式,优先提取纯音频轨(体积小) 2. ffmpeg版本注意:必须使用imageio-ffmpeg完整版,Playwright自带的精简版缺少mp4解码器会报错 3. 长视频超时:单次转写受执行环境约5分钟超时限制,超长视频启用分段策略 4. 同音错字处理:国学、方言、专业术语视频需结合上下文校正,技能会自动处理但会告知用户做了哪些校正 5. 无语音视频:纯背景音乐或无语音视频转写结果为空,如实告知用户即可


来源:GitHub https://github.com/Luo4507/video-to-text