跳到主要内容

5 篇博文 含有标签「transcription」

查看所有标签

实时语音转录怎么接:讯飞、阿里云、火山引擎、腾讯云四条路线

· 阅读需 14 分钟

这次先把问题收窄到最核心的一层:不要会议纪要,不要 AI 总结,不要录音上传后处理,只要“边说边出字”的实时语音转录

这件事不是去 GitHub 找一个 Whisper WebUI 就能解决。真正的实时 ASR 交付,是浏览器或客户端持续推送音频流,ASR 服务持续返回 partial/final transcript。中文场景里,第一轮应该直接测成熟云服务:科大讯飞、阿里云、火山引擎、腾讯云。

同主题前情

本文只回答下一步:四家国内实时 ASR 分别怎么接、在哪里操作、需不需要服务器、我能帮你做到哪一步。

科大讯飞实时语音转写从注册到接入:一份可边实践边更新的教程

· 阅读需 14 分钟

这篇不是泛泛介绍 ASR,而是为了把一条很具体的实践路径跑通:第一次使用科大讯飞开放平台,从注册、创建应用、开通实时语音转写,到拿到密钥、跑 SDK/API demo,最后接到我们自己的网页实时字幕服务。

同主题前情

Speakr 实操:录完之后,转写和 AI 纪要到底在哪里

· 阅读需 9 分钟

前两篇文章先做了大地图:录音转写与会议笔记自建选型 负责区分会议 bot、录音文件后台、字幕工具和 ASR 底座;网页录音到 AI 纪要 负责把需求拆成网页录音、成熟 ASR 和 AI 后处理三层。

这篇只补一个实操问题:如果先部署 Speakr,用户录完音以后,文字和 AI 纪要到底在哪里?

结论先说清楚:Speakr 不是“边说边实时出字”的字幕工具。它更像一个自托管的录音/上传后台:

录音 / 上传音频
-> 点击上传进入后台任务
-> ASR 生成 Transcription
-> LLM 基于 transcript 生成 Summary / Minutes
-> 在 recording detail 里查看和导出

如果你期待的是打开网页、点录音、一边说一边看到 partial transcript,那应该换 Deepgram、AssemblyAI、Azure Speech、OpenAI Realtime、FunASR streaming、sherpa-onnx streaming、WhisperLive 这类实时 ASR 路线,而不是继续把 Speakr 当实时字幕用。

网页录音到 AI 纪要:先选成熟 ASR,再看现成产品

· 阅读需 14 分钟

这次把问题重新收窄:目标不是先找一个“会议笔记大平台”,而是要确认能不能稳定搭出这一条链路:

网页录音按钮 -> ASR 实时/准实时转文字 -> AI 纠错/摘要/会议纪要

这里的关键不是 UI 有多复杂,而是 ASR 是否足够成熟:中文识别、实时 partial/final、低延迟、长录音稳定性、标点断句、说话人、成本、以及能否安全接到浏览器。

同主题前情

本文只回答一个更具体的问题:如果要做“一个网页,点录音,实时出字,最后自动生成 AI 笔记”,应该先选哪个 ASR 路线?有没有现成项目已经打通整个流程?

录音转写与会议笔记自建选型:Vexa、Scriberr、Whishper 与 Whisper 底座

· 阅读需 15 分钟

录音转写看起来像一个单点能力:给一段音频,返回文字。真的要自建时,它会很快拆成几个完全不同的问题:谁负责录音或进会?是实时字幕还是会后处理?要不要说话人?要不要摘要、行动项和问答?要不要 API、权限、队列和搜索?

如果不先把这些产品形态分开,就很容易把 openai/whisperfaster-whisperWhisperX、一个 Gradio WebUI、一个会议 bot、一个媒体库平台放进同一张表里比较,最后得到一堆“都能转写”的无效结论。

这篇只做静态调研,关注 GitHub 上可自建、可部署或可封装的项目,重点场景是录音转写、会议笔记和后续 ChatArch/Agent 工作流集成。