本文根据 Buzz 官方 GitHub 仓库 README 整理,资料核对于 2026-10-11。开源项目变化快,以官方仓库为准。
是什么
Buzz 是一款给 Whisper 套上图形界面的桌面软件,仓库 chidiwilliams/buzz 约有 2.19 万星标,采用 MIT 许可。Whisper 是 OpenAI 开源的语音识别模型,效果很好,但原版要装 Python、敲命令行;Buzz 把这些都包起来,下载、安装、把文件拖进去,就能得到文字稿和字幕。
转写在你的电脑上离线完成,音频不会上传到任何服务器——这是它相对各种在线转写网站最大的优势。
能做什么
README 列出的功能:
- 转写音视频文件:常见的音频和视频格式都可以直接导入;
- YouTube 链接:粘贴链接后下载并转写;
- 麦克风实时转写:边说边出文字;
- 翻译:把语音内容翻译输出;
- 说话人识别:区分不同的发言者;
- 导出:TXT 纯文本,以及 SRT、VTT 字幕文件;
- 进阶功能:监视文件夹(放进去的文件自动转写)、命令行接口和插件系统。
怎么上手
- 安装:
- Windows:下载安装程序;
- macOS:下载 .dmg;
- Linux:Flatpak、Snap 或 AppImage;
- 也可以用
pip install buzz-captions安装。
README 说明安装包托管在 SourceForge,从仓库 README 里的链接进入最稳妥。
- 打开软件,把音频或视频文件拖入窗口。
- 选择模型大小和语言。中文内容建议明确指定语言;电脑配置一般就选小一档的模型。
- 首次使用某个模型时会自动下载,之后即可离线使用。
- 转写完成后在界面里校对,再导出为需要的格式。
做视频字幕的常用流程:导出 SRT → 在剪映等剪辑软件里导入字幕 → 逐句校对错别字和断句。
免费与付费
GitHub 上的版本完全免费开源,没有时长和次数限制。应用商店中如有收费的同名版本,以其页面说明为准;本文介绍的是官方仓库提供的免费版本。
适合谁 / 不适合谁
适合:
- 经常要把访谈、网课、会议录音整理成文字的学生、记者、研究者;
- 需要给视频加字幕的创作者;
- 录音内容敏感、不能上传到云端的用户。
不适合:
- 电脑配置低又想快速转写很长的音频——大模型在没有显卡的机器上会很慢;
- 需要多人协作编辑文稿、自动生成会议纪要和待办的团队,飞书妙记、通义听悟这类云端产品更合适;
- 需要长期稳定的实时同传字幕的专业场景。
注意事项
- 转写结果必须校对:同音字、人名、专业术语是高发错误,静音或有背景音乐的段落可能出现凭空生成的句子。
- 模型文件较大:每个模型从几十 MB 到几 GB 不等,下载需要稳定的网络。
- 下载 YouTube 内容前,确认你有权使用该视频的音频。
- 录音合规:转写他人谈话前应取得对方同意。
0 条评论
还没有评论,来抢沙发~