跳到主要内容

2 篇博文 含有标签「qwen-audio」

查看所有标签

Speakr:我们现在用的网页录音与实时语音工作台

· 阅读需 7 分钟

我们最早只是想做一个顺手的网页录音页:打开浏览器,允许麦克风,然后一边说一边看到文字。真正开始使用以后,事情很快变复杂了。录音能不能暂停,结束后能不能接着录,临时识别结果为什么会反复变化,两小时的会议会不会把浏览器或 GPU 撑满,这些都比“接一个语音模型”更接近真实问题。

现在这套网站放在 speakr.public.wzhecnu.cn。页面中文名仍是“声笺”,代码来自我们持续改造的 Qwen Audio Demo 仓库。它目前有三个相互独立的工作区:会议记录、声音工作室和实时对话。

这里的 Speakr 指 ChatArch 当前部署的这套语音工作台,并不是把同名开源项目原样部署后换了一个页面。

阿里云实时语音识别从注册到接入:百炼 ASR 实践教程

· 阅读需 16 分钟

这篇和科大讯飞教程一样,不写泛泛产品介绍,而是把一条可实践路径讲清楚:第一次使用阿里云百炼 / Model Studio,怎么开通实时语音识别,怎么确认额度和计费,怎么拿 API Key,怎么跑 DashScope SDK 或 WebSocket,最后怎么接到我们自己的网页实时字幕服务。

同主题前情