会议录音不想上传?

本地 Whisper,1小时约3分半出稿

我有一堆录音:会议、访谈、播客。转文字通常只有两条路——

一条是上传到在线服务:排队、限时长、按分钟收费,转完还不知道文件存在哪。开会录的内容,凭什么都让服务器过一遍?

另一条是本地跑 Whisper。隐私是有了,但装环境、配模型、敲命令行,足够劝退大多数人。

所以我做了个本地网页工具,叫 whisper-tools。音频拖进去就转;1小时录音约3分半出稿,全程不联网,也不用花钱

想快速就直接用:codex GPT / WorkBuddy / Hermes等工具直接安装

用法只有三步:下载仓库 → 双击 install.bat → 把音频拖进浏览器。缺 ffmpeg 它自己装;有 NVIDIA 显卡会提示开 GPU 加速;不装或装失败,自动切 CPU。不用改配置,不用研究模型路径。整个文件夹也能拖:子目录递归收进来,多文件排队转,同名文件不打架。

本机实测(RTX 4070 Laptop,turbo 模型):

  • 30秒录音 → 1.2秒
  • 3.5分钟的歌 → 19秒
  • 1小时音频 → 约3分半

原生 Whisper 的中文稿经常没法直接交。我把自己翻车过的点都修进去了:半角标点转全角(1,20012:30 不误伤);汉字间空格自动删;繁转简;按22–46字分段;转歌开头的「嗯嗯嗯」和「Zither Harp」式幻听自动掐掉

一个坑:medium 不是「更准更慢一点」。同一首3.5分钟带伴奏的歌,turbo 19.2秒,medium 693秒,约慢36倍,标点还更差。转歌一律 turbo。结果不满意,页面上换模型重转,不用重新拖文件

限制也说清楚:带伴奏的歌最难,个别字会错(「唱片店」变「长片店」),纯音乐尾奏偶尔幻听。会议、口播、播客这类清晰语音,基本能直接用。目前只在 Windows 10/11 上跑。

GitHub(MIT 开源):

https://github.com/gaoren7716-lab/whisper-tools

目前测试日常音频文件转文字,基本没啥大毛病可以直接使用!!!

重点不是 Whisper 能不能转

而是你愿不愿意把会议、访谈、客户沟通这些录音,全部交给别人的服务器。

对敏感内容来说,本地离线不是加分项,是底线:音频不出本机、不联网、不收费、没有时长限制

适合会议记录、访谈整理、播客归档,也适合任何不想把录音传到云端的人

收藏给下次整理录音时用。转给那个还在一边听、一边手动打字的人

有任何问题可以留言!!!