跳到主要内容

ChatVideo:可以直接部署的视频总结与知识库项目整理

· 阅读需 11 分钟

如果不想从零写视频网页理解流水线,可以先试几个已经能跑起来的开源项目。这里按“能不能直接部署”“是否支持 B 站”“是否有 Web UI”“是否包含 ASR/VLM/知识库能力”来筛了一轮。

一句话结论

最快验证 B 站视频总结,先试 BiliSum;想部署一个完整 Web 学习助手,试 Video Helper;想看成熟在线产品形态,参考 BibiGPT;想做轻量 Python/Gradio PoC,参考 websum

对比表

项目最适合什么B 站Web UIDocker关键能力
BiliSumB 站深度总结、本地知识库是,docker runASR、VLM 图文笔记、思维导图、RAG、多 P
Video Helper完整视频学习助手是,Composesummary、mind map、Q&A、quiz、关键帧
BibiGPT v1在线音视频总结产品参考是,Compose / VercelB 站/YouTube 摘要、缓存、限流
websum轻量 CLI/Gradio PoC否,偏 YouTube/Web是,GradioOllama/OpenAI backend、CLI/library
openclaw-video-visionURL + 抽帧 + VLM pipeline 参考yt-dlp、Playwright fallback、frames/audio/VLM
openclaw-knowledge-distillerAgent/CLI 知识文章生成subtitles/ASR、style presets、MCP
video-summarizerClaude Code skill 自动化yt-dlp、ffmpeg、faster-whisper 自动安装
bilibili-summary小型 B 站桌面工具参考pywebviewFastAPI、收藏夹、ASR fallback

下面展开最值得先试的几个。

BiliSum:最贴近 B 站场景

Repo: lycohana/BiliSum

BiliSum 的定位是“AI 视频总结与知识库工具”:把 B 站、YouTube 和本地视频沉淀成可检索、可追问、可导出的知识笔记。它对 B 站做得比较深:支持 B 站链接、扫码登录/cookies、多 P 视频、全集总结、知识库 RAG、图文笔记和思维导图。

BiliSum 首页

它解决了什么

  • 输入:B 站链接、YouTube 链接、本地视频文件。
  • 转写:SiliconFlow ASR、多模态 ASR、本地 Whisper、FunASR/QwenASR。
  • 总结:OpenAI-compatible、Anthropic Claude、本地规则降级。
  • 视觉:VLM 图文笔记,按截图和画面重新组织文章结构。
  • 知识库:Embedding 检索 + LLM Agent,可跨视频问答。
  • 导出:Markdown、Obsidian 格式、截图打包。

BiliSum 的图文笔记路线很值得参考:不是把截图堆在末尾,而是让 VLM 读取截图和原始笔记,再把图片插入对应知识段落。

BiliSum VLM 图文笔记

它还提供思维导图和知识库视图,适合长课程、技术分享和学习资料沉淀。

BiliSum 思维导图

怎么部署

BiliSum 有 Docker 浏览器版,最小运行方式是:

docker pull lycohana/bilisum:latest

docker run --rm -p 3838:3838 \
-v bilisum-data:/data \
-e VIDEO_SUM_ACCESS_TOKEN=replace-with-a-long-random-token \
-e VIDEO_SUM_LLM_ENABLED=true \
-e VIDEO_SUM_LLM_BASE_URL=https://your-openai-compatible-endpoint/v1 \
-e VIDEO_SUM_LLM_MODEL=your-model \
-e VIDEO_SUM_LLM_API_KEY=your-key \
-e VIDEO_SUM_SILICONFLOW_ASR_API_KEY=your-asr-key \
lycohana/bilisum:latest

访问:http://127.0.0.1:3838

凭据处理

上面的 key 都是占位符。真实部署时放 .env、secret manager 或服务器环境变量,不写进 Git、blog、issue、日志和截图。

你需要准备什么

需要提供是否必需说明
服务器和 Docker必需单容器部署最简单
LLM API key基本必需用于摘要、问答和知识库生成
ASR key 或本地 ASR建议无字幕或字幕质量差时需要
B 站 cookies/扫码登录可选公开视频可先不配,遇到风控再配
持久化卷 /data必需保存任务、缓存、数据库和笔记
VLM/视觉模型 key可选需要图文笔记时再开启
Twelve Labs key可选本地视频的直接视频理解增强

适合 ChatVideo 的结论:第一优先试跑。它和我们讨论的“B 站 URL -> transcript -> 截图/VLM -> summary/knowledge base”最贴近。

Video Helper:完整 Web 学习助手

Repo: LDJ-creat/video-helper

Video Helper 更像一个完整产品:Next.js 前端 + FastAPI 后端 + SQLite + Docker Compose。它的目标不是只输出一段摘要,而是围绕学习场景做视频分析、知识检索、笔记、思维导图、问答和 quiz。

Video Helper 系统架构

它解决了什么

  • 输入:Bilibili、YouTube、TikTok、本地视频。
  • Pipeline:视频下载、音频转写、内容提取、结构化分析。
  • 学习形态:mind map、key summaries、内容模块、视频时间戳跳转。
  • 交互:基于视频上下文的 AI Q&A。
  • 练习:自动生成 quiz。
  • 转写:推荐云 ASR,也支持本地 faster-whisper fallback。
  • 视觉:通过 FFmpeg 做 keyframe extraction,为摘要提供画面上下文。

它的核心 flow 很适合拿来对照 ChatVideo 自建 pipeline:

Video Helper 核心视频分析流程

怎么部署

README 给出的部署方式是:

git clone https://github.com/LDJ-creat/video-helper.git
cd video-helper
docker compose up -d

默认访问:

Web UI: http://localhost:3000
Backend API: http://localhost:8000

它的 docker-compose.yml 默认拉 GHCR 镜像:

ghcr.io/ldj-creat/video-helper-core:latest
ghcr.io/ldj-creat/video-helper-web:latest

当前我们这台服务器已经有 Docker,但没有 docker compose 插件。如果要直接试它,需要先补 compose plugin,或者临时改成两个 docker run

你需要准备什么

需要提供是否必需说明
Docker + Docker Compose必需官方直接部署路径用 Compose
3000/8000 端口或反代必需Web 和 API 分开
数据目录必需Compose 默认持久化到项目 data/
ASR provider key建议长视频用云 ASR 会快很多
LLM provider key必需总结、问答、quiz 都需要
B 站 cookies可选登录/风控/受限内容时需要

适合 ChatVideo 的结论:适合看“完整 Web 产品怎么组织前后端、任务状态和学习交互”。如果我们要做 ChatVideo Web 产品,它是很好的参考。

BibiGPT v1:成熟在线产品形态参考

Repo: JimmyLv/BibiGPT-v1

BibiGPT 是更早的一键音视频总结产品,支持 Bilibili、YouTube、Twitter、TikTok、podcast、lecture、meeting 等内容。它基于 Next.js / Vercel Edge functions,并用 OpenAI-compatible provider 做流式总结。

BibiGPT 产品截图

它解决了什么

  • 一键输入音视频链接,生成 AI 摘要。
  • 支持缓存和 rate limit,适合公开 Web 服务。
  • 有 Vercel 部署路径。
  • 有 Docker Compose 支持。

怎么部署

本地开发:

npm run dev

Vercel 部署:按 example.env 配置环境变量。

Docker:

# configure .env first
docker compose up -d

适合 ChatVideo 的结论:BibiGPT 更适合作为产品体验和 Web 交互参考,不一定是最好的底层视频理解 pipeline 参考。它的价值在于“一个公开视频服务怎么做入口、缓存、限流和流式输出”。

websum:轻量 Python / Gradio 骨架

Repo: cobanov/websum

websum 比上面几个都轻:它是 Python library + CLI + optional Gradio UI,支持网页和 YouTube,总结 backend 可以用 Ollama 或 OpenAI。

websum Gradio UI

它解决了什么

  • websum summarize https://example.com 这类 CLI。
  • websum ui --port 7860 这类 Gradio UI。
  • Ollama local 和 OpenAI backend 可切换。
  • API 很干净,适合参考 ChatVideo 后续怎么设计 pluggable backend。

怎么部署

docker build -t websum .
docker run -p 7860:7860 websum

或者:

pip install 'websum[ui,ollama]'
websum ui --port 7860

局限也很明确:它不直接支持 B 站,也没有抽帧/VLM。它适合做“我们自己写 ChatVideo ingest/summarize 时的轻量骨架参考”。

openclaw-video-vision:URL + 视觉理解 pipeline 参考

Repo: maim010/openclaw-video-vision

这个项目不是现成 Web 服务,但 pipeline 很贴近我们想做的底层能力:

URL + cookies/proxy
-> yt-dlp metadata / media
-> browser fallback
-> FFmpeg frames + audio
-> whisper transcript
-> vision model
-> structured summary + key moments + timestamps

它支持 YouTube、Bilibili 和任意包含 video 元素的页面;还能在 yt-dlp 失败时走 Playwright/browser fallback。这个思路非常适合 ChatVideo 自建方案。

直接运行示例:

git clone https://github.com/maim010/openclaw-video-vision.git
cd openclaw-video-vision
npm install
export VIDEO_VISION_API_KEY="your-key"
node src/index.js "https://www.bilibili.com/video/BV..."

适合 ChatVideo 的结论:不要把它当部署产品,应该把它当 extraction + keyframe + VLM pipeline 参考。

openclaw-knowledge-distiller:CLI/MCP 知识文章生成

Repo: destinyfrancis/openclaw-knowledge-distiller

它把 YouTube、Bilibili、Facebook 视频转成结构化知识文章,支持字幕检测、ASR fallback、不同 summary styles,以及 MCP server。

pip install openclaw-knowledge-distiller
kd process "https://youtube.com/watch?v=..." --output notes.md
kd process "https://www.bilibili.com/video/BV..." --style academic --format markdown

它更适合 agent 工具链,不是 Web 部署首选。另一个限制是本地 ASR 路线偏 Apple Silicon / MLX,Linux 服务器上要谨慎评估。

其他小项目

liang121/video-summarizer

Repo: liang121/video-summarizer

这是 Claude Code skill,不是独立服务。优点是自动化链路清晰:自动装 yt-dlpffmpegfaster-whisper,下载视频、抽字幕、无字幕时 Whisper 转写,再生成结构化摘要。适合参考“agent skill 里如何组织自动化工作流”。

jackwener/bilibili-summary

Repo: jackwener/bilibili-summary

小型 B 站桌面总结工具,FastAPI + pywebview,支持 URL、UP、收藏夹和 ASR fallback。没有 Docker,但可以参考 B 站收藏夹、扫码登录和桌面壳交互。

如果要在服务器上先部署,选哪个

我会按这个顺序试:

第一轮:BiliSum

原因:

  • B 站能力最完整。
  • Docker 单容器最容易跑。
  • 包含我们关心的 ASR、VLM 图文笔记、知识库和多 P。
  • 适合作为 ChatVideo PoC 的外部对标。

需要准备:

LLM endpoint + model + API key
ASR key 或本地 ASR 配置
访问 token
/data 持久化目录
可选 B 站 cookies
可选 VLM/Twelve Labs key

第二轮:Video Helper

原因:

  • 更像完整 Web 产品。
  • 有前后端、任务状态、mind map、Q&A、quiz。
  • 适合看 ChatVideo 如果要做 Web UI,该怎么组织。

需要准备:

Docker Compose plugin
LLM key
ASR key
3000/8000 端口或反代配置
数据目录
可选 B 站 cookies

第三轮:websum / openclaw-video-vision

原因:

  • 不一定直接用于用户,但适合拆模块学习。
  • websum 看 Python CLI/UI/backends 插拔。
  • openclaw-video-vision 看 URL extraction、browser fallback、frames/audio、VLM summary。

推荐给 ChatVideo 的整合方式

短期不要直接把这些项目并进 ChatVideo 包。更稳的方式是:

  1. 先部署 BiliSum 或 Video Helper,验证实际效果。
  2. 选一个公开视频 URL,比较“字幕-only”和“字幕 + 截图/VLM”的摘要差异。
  3. 把通用 evidence schema 沉淀到 ChatVideo 文档。
  4. 等自研 pipeline 跑通后,再考虑 chatvideo ingest urlchatvideo summarize 真实 CLI。

这样 ChatVideo 既能吸收已有项目的成熟经验,又不会过早把未实现能力包装成命令。

图片来源

本文图片来自对应开源项目 README 或仓库内 assets,用于项目调研说明: