跳到主要内容

2 篇博文 含有标签「speakr」

查看所有标签

Speakr:我们现在用的网页录音与实时语音工作台

· 阅读需 7 分钟

我们最早只是想做一个顺手的网页录音页:打开浏览器,允许麦克风,然后一边说一边看到文字。真正开始使用以后,事情很快变复杂了。录音能不能暂停,结束后能不能接着录,临时识别结果为什么会反复变化,两小时的会议会不会把浏览器或 GPU 撑满,这些都比“接一个语音模型”更接近真实问题。

现在这套网站放在 speakr.public.wzhecnu.cn。页面中文名仍是“声笺”,代码来自我们持续改造的 Qwen Audio Demo 仓库。它目前有三个相互独立的工作区:会议记录、声音工作室和实时对话。

这里的 Speakr 指 ChatArch 当前部署的这套语音工作台,并不是把同名开源项目原样部署后换了一个页面。

Speakr 实操:录完之后,转写和 AI 纪要到底在哪里

· 阅读需 9 分钟

前两篇文章先做了大地图:录音转写与会议笔记自建选型 负责区分会议 bot、录音文件后台、字幕工具和 ASR 底座;网页录音到 AI 纪要 负责把需求拆成网页录音、成熟 ASR 和 AI 后处理三层。

这篇只补一个实操问题:如果先部署 Speakr,用户录完音以后,文字和 AI 纪要到底在哪里?

结论先说清楚:Speakr 不是“边说边实时出字”的字幕工具。它更像一个自托管的录音/上传后台:

录音 / 上传音频
-> 点击上传进入后台任务
-> ASR 生成 Transcription
-> LLM 基于 transcript 生成 Summary / Minutes
-> 在 recording detail 里查看和导出

如果你期待的是打开网页、点录音、一边说一边看到 partial transcript,那应该换 Deepgram、AssemblyAI、Azure Speech、OpenAI Realtime、FunASR streaming、sherpa-onnx streaming、WhisperLive 这类实时 ASR 路线,而不是继续把 Speakr 当实时字幕用。