ChatVideo:可以直接部署的视频总结与知识库项目整理
如果不想从零写视频网页理解流水线,可以先试几个已经能跑起来的开源项目。这里按“能不能直接部署”“是否支持 B 站”“是否有 Web UI”“是否包含 ASR/VLM/知识库能力”来筛了一轮。
最快验证 B 站视频总结,先试 BiliSum;想部署一个完整 Web 学习助手,试 Video Helper;想看成熟在线产品形态,参考 BibiGPT;想做轻量 Python/Gradio PoC,参考 websum。
对比表
| 项目 | 最适合什么 | B 站 | Web UI | Docker | 关键能力 |
|---|---|---|---|---|---|
| BiliSum | B 站深度总结、本地知识库 | 是 | 是 | 是,docker run | ASR、VLM 图文笔记、思维导图、RAG、多 P |
| Video Helper | 完整视频学习助手 | 是 | 是 | 是,Compose | summary、mind map、Q&A、quiz、关键帧 |
| BibiGPT v1 | 在线音视频总结产品参考 | 是 | 是 | 是,Compose / Vercel | B 站/YouTube 摘要、缓存、限流 |
| websum | 轻量 CLI/Gradio PoC | 否,偏 YouTube/Web | 是,Gradio | 是 | Ollama/OpenAI backend、CLI/library |
| openclaw-video-vision | URL + 抽帧 + VLM pipeline 参考 | 是 | 否 | 否 | yt-dlp、Playwright fallback、frames/audio/VLM |
| openclaw-knowledge-distiller | Agent/CLI 知识文章生成 | 是 | 否 | 否 | subtitles/ASR、style presets、MCP |
| video-summarizer | Claude Code skill 自动化 | 是 | 否 | 否 | yt-dlp、ffmpeg、faster-whisper 自动安装 |
| bilibili-summary | 小型 B 站桌面工具参考 | 是 | pywebview | 否 | FastAPI、收藏夹、ASR fallback |
下面展开最值得先试的几个。
BiliSum:最贴近 B 站场景
Repo: lycohana/BiliSum
BiliSum 的定位是“AI 视频总结与知识库工具”:把 B 站、YouTube 和本地视频沉淀成可检索、可追问、可导出的知识笔记。它对 B 站做得比较深:支持 B 站链接、扫码登录/cookies、多 P 视频、全集总结、知识库 RAG、图文笔记和思维导图。

它解决了什么
- 输入:B 站链接、YouTube 链接、本地视频文件。
- 转写:SiliconFlow ASR、多模态 ASR、本地 Whisper、FunASR/QwenASR。
- 总结:OpenAI-compatible、Anthropic Claude、本地规则降级。
- 视觉:VLM 图文笔记,按截图和画面重新组织文章结构。
- 知识库:Embedding 检索 + LLM Agent,可跨视频问答。
- 导出:Markdown、Obsidian 格式、截图打包。
BiliSum 的图文笔记路线很值得参考:不是把截图堆在末尾,而是让 VLM 读取截图和原始笔记,再把图片插入对应知识段落。

它还提供思维导图和知识库视图,适合长课程、技术分享和学习资料沉淀。

怎么部署
BiliSum 有 Docker 浏览器版,最小运行方式是:
docker pull lycohana/bilisum:latest
docker run --rm -p 3838:3838 \
-v bilisum-data:/data \
-e VIDEO_SUM_ACCESS_TOKEN=replace-with-a-long-random-token \
-e VIDEO_SUM_LLM_ENABLED=true \
-e VIDEO_SUM_LLM_BASE_URL=https://your-openai-compatible-endpoint/v1 \
-e VIDEO_SUM_LLM_MODEL=your-model \
-e VIDEO_SUM_LLM_API_KEY=your-key \
-e VIDEO_SUM_SILICONFLOW_ASR_API_KEY=your-asr-key \
lycohana/bilisum:latest
访问:http://127.0.0.1:3838。
上面的 key 都是占位符。真实部署时放 .env、secret manager 或服务器环境变量,不写进 Git、blog、issue、日志和截图。
你需要准备什么
| 需要提供 | 是否必需 | 说明 |
|---|---|---|
| 服务器和 Docker | 必需 | 单容器部署最简单 |
| LLM API key | 基本必需 | 用于摘要、问答和知识库生成 |
| ASR key 或本地 ASR | 建议 | 无字幕或字幕质量差时需要 |
| B 站 cookies/扫码登录 | 可选 | 公开视频可先不配,遇到风控再配 |
持久化卷 /data | 必需 | 保存任务、缓存、数据库和笔记 |
| VLM/视觉模型 key | 可选 | 需要图文笔记时再开启 |
| Twelve Labs key | 可选 | 本地视频的直接视频理解增强 |
适合 ChatVideo 的结论:第一优先试跑。它和我们讨论的“B 站 URL -> transcript -> 截图/VLM -> summary/knowledge base”最贴近。
Video Helper:完整 Web 学习助手
Repo: LDJ-creat/video-helper
Video Helper 更像一个完整产品:Next.js 前端 + FastAPI 后端 + SQLite + Docker Compose。它的目标不是只输出一段摘要,而是围绕学习场景做视频分析、知识检索、笔记、思维导图、问答和 quiz。

它解决了什么
- 输入:Bilibili、YouTube、TikTok、本地视频。
- Pipeline:视频下载、音频转写、内容提取、结构化分析。
- 学习形态:mind map、key summaries、内容模块、视频时间戳跳转。
- 交互:基于视频上下文的 AI Q&A。
- 练习:自动生成 quiz。
- 转写:推荐云 ASR,也支持本地 faster-whisper fallback。
- 视觉:通过 FFmpeg 做 keyframe extraction,为摘要提供画面上下文。
它的核心 flow 很适合拿来对照 ChatVideo 自建 pipeline:

怎么部署
README 给出的部署方式是:
git clone https://github.com/LDJ-creat/video-helper.git
cd video-helper
docker compose up -d
默认访问:
Web UI: http://localhost:3000
Backend API: http://localhost:8000
它的 docker-compose.yml 默认拉 GHCR 镜像:
ghcr.io/ldj-creat/video-helper-core:latest
ghcr.io/ldj-creat/video-helper-web:latest
当前我们这台服务器已经有 Docker,但没有 docker compose 插件。如果要直接试它,需要先补 compose plugin,或者临时改成两个 docker run。
你需要准备什么
| 需要提供 | 是否必需 | 说明 |
|---|---|---|
| Docker + Docker Compose | 必需 | 官方直接部署路径用 Compose |
| 3000/8000 端口或反代 | 必需 | Web 和 API 分开 |
| 数据目录 | 必需 | Compose 默认持久化到项目 data/ |
| ASR provider key | 建议 | 长视频用云 ASR 会快很多 |
| LLM provider key | 必需 | 总结、问答、quiz 都需要 |
| B 站 cookies | 可选 | 登录/风控/受限内容时需要 |
适合 ChatVideo 的结论:适合看“完整 Web 产品怎么组织前后端、任务状态和学习交互”。如果我们要做 ChatVideo Web 产品,它是很好的参考。
BibiGPT v1:成熟在线产品形态参考
Repo: JimmyLv/BibiGPT-v1
BibiGPT 是更早的一键音视频总结产品,支持 Bilibili、YouTube、Twitter、TikTok、podcast、lecture、meeting 等内容。它基于 Next.js / Vercel Edge functions,并用 OpenAI-compatible provider 做流式总结。

它解决了什么
- 一键输入音视频链接,生成 AI 摘要。
- 支持缓存和 rate limit,适合公开 Web 服务。
- 有 Vercel 部署路径。
- 有 Docker Compose 支持。
怎么部署
本地开发:
npm run dev
Vercel 部署:按 example.env 配置环境变量。
Docker:
# configure .env first
docker compose up -d
适合 ChatVideo 的结论:BibiGPT 更适合作为产品体验和 Web 交互参考,不一定是最好的底层视频理解 pipeline 参考。它的价值在于“一个公开视频服务怎么做入口、缓存、限流和流式输出”。
websum:轻量 Python / Gradio 骨架
Repo: cobanov/websum
websum 比上面几个都轻:它是 Python library + CLI + optional Gradio UI,支持网页和 YouTube,总结 backend 可以用 Ollama 或 OpenAI。

它解决了什么
websum summarize https://example.com这类 CLI。websum ui --port 7860这类 Gradio UI。- Ollama local 和 OpenAI backend 可切换。
- API 很干净,适合参考 ChatVideo 后续怎么设计 pluggable backend。
怎么部署
docker build -t websum .
docker run -p 7860:7860 websum
或者:
pip install 'websum[ui,ollama]'
websum ui --port 7860
局限也很明确:它不直接支持 B 站,也没有抽帧/VLM。它适合做“我们自己写 ChatVideo ingest/summarize 时的轻量骨架参考”。
openclaw-video-vision:URL + 视觉理解 pipeline 参考
Repo: maim010/openclaw-video-vision
这个项目不是现成 Web 服务,但 pipeline 很贴近我们想做的底层能力:
URL + cookies/proxy
-> yt-dlp metadata / media
-> browser fallback
-> FFmpeg frames + audio
-> whisper transcript
-> vision model
-> structured summary + key moments + timestamps
它支持 YouTube、Bilibili 和任意包含 video 元素的页面;还能在 yt-dlp 失败时走 Playwright/browser fallback。这个思路非常适合 ChatVideo 自建方案。
直接运行示例:
git clone https://github.com/maim010/openclaw-video-vision.git
cd openclaw-video-vision
npm install
export VIDEO_VISION_API_KEY="your-key"
node src/index.js "https://www.bilibili.com/video/BV..."
适合 ChatVideo 的结论:不要把它当部署产品,应该把它当 extraction + keyframe + VLM pipeline 参考。
openclaw-knowledge-distiller:CLI/MCP 知识文章生成
Repo: destinyfrancis/openclaw-knowledge-distiller
它把 YouTube、Bilibili、Facebook 视频转成结构化知识文章,支持字幕检测、ASR fallback、不同 summary styles,以及 MCP server。
pip install openclaw-knowledge-distiller
kd process "https://youtube.com/watch?v=..." --output notes.md
kd process "https://www.bilibili.com/video/BV..." --style academic --format markdown
它更适合 agent 工具链,不是 Web 部署首选。另一个限制是本地 ASR 路线偏 Apple Silicon / MLX,Linux 服务器上要谨慎评估。
其他小项目
liang121/video-summarizer
Repo: liang121/video-summarizer
这是 Claude Code skill,不是独立服务。优点是自动化链路清晰:自动装 yt-dlp、ffmpeg、faster-whisper,下载视频、抽字幕、无字幕时 Whisper 转写,再生成结构化摘要。适合参考“agent skill 里如何组织自动化工作流”。
jackwener/bilibili-summary
Repo: jackwener/bilibili-summary
小型 B 站桌面总结工具,FastAPI + pywebview,支持 URL、UP、收藏夹和 ASR fallback。没有 Docker,但可以参考 B 站收藏夹、扫码登录和桌面壳交互。
如果要在服务器上先部署,选哪个
我会按这个顺序试:
第一轮:BiliSum
原因:
- B 站能力最完整。
- Docker 单容器最容易跑。
- 包含我们关心的 ASR、VLM 图文笔记、知识库和多 P。
- 适合作为 ChatVideo PoC 的外部对标。
需要准备:
LLM endpoint + model + API key
ASR key 或本地 ASR 配置
访问 token
/data 持久化目录
可选 B 站 cookies
可选 VLM/Twelve Labs key
第二轮:Video Helper
原因:
- 更像完整 Web 产品。
- 有前后端、任务状态、mind map、Q&A、quiz。
- 适合看 ChatVideo 如果要做 Web UI,该怎么组织。
需要准备:
Docker Compose plugin
LLM key
ASR key
3000/8000 端口或反代配置
数据目录
可选 B 站 cookies
第三轮:websum / openclaw-video-vision
原因:
- 不一定直接用于用户,但适合拆模块学习。
websum看 Python CLI/UI/backends 插拔。openclaw-video-vision看 URL extraction、browser fallback、frames/audio、VLM summary。
推荐给 ChatVideo 的整合方式
短期不要直接把这些项目并进 ChatVideo 包。更稳的方式是:
- 先部署 BiliSum 或 Video Helper,验证实际效果。
- 选一个公开视频 URL,比较“字幕-only”和“字幕 + 截图/VLM”的摘要差异。
- 把通用 evidence schema 沉淀到 ChatVideo 文档。
- 等自研 pipeline 跑通后,再考虑
chatvideo ingest url和chatvideo summarize真实 CLI。
这样 ChatVideo 既能吸收已有项目的成熟经验,又不会过早把未实现能力包装成命令。
图片来源
本文图片来自对应开源项目 README 或仓库内 assets,用于项目调研说明:
- BiliSum screenshots: lycohana/BiliSum
- Video Helper diagrams: LDJ-creat/video-helper
- BibiGPT screenshot: JimmyLv/BibiGPT-v1
- websum screenshot: cobanov/websum