noScribe 是一款专为访谈/采访自动转录设计的开源桌面软件,结合了 OpenAI Whisper(语音转文字)和 pyannote(说话人识别),并提供友好的图形界面和专用编辑器。

GitHubhttps://github.com/kaixxx/noScribe
当前版本:0.7
许可证:GPL-3.0
作者:Kai Dröge(社会学博士,瑞士卢塞恩应用科学大学)


核心特点

  • 完全本地运行:所有处理都在你的电脑上完成,不上传到云端,保护访谈隐私
  • 高质量转录:基于 Whisper(faster-whisper)+ pyannote 说话人分离
  • 支持约 60 种语言
  • 说话人识别:可区分不同说话人,并可指定人数或自动检测
  • 专用编辑器(noScribeEdit):方便校对、修改转录结果
  • 支持批量处理
  • 输出格式:HTML(默认,编辑器友好)、VTT(字幕/导入 EXMARaLDA)、TXT

特别适合定性社会研究新闻采访场景。


主要功能设置

  • 语言选择(支持 auto 检测、多语言实验性支持)
  • 质量模式:Precise(更准) / Fast(更快)
  • 停顿标记(可选标记 1s+ / 2s+ / 3s+ 的停顿)
  • 说话人检测(指定人数 / auto / 关闭)
  • 重叠语音标记(实验性)
  • 不流畅现象(um、未完成句子等)是否保留
  • 可指定起止时间戳,方便先测试一小段

系统要求与下载

支持平台:Windows、macOS、Linux

下载地址托管在瑞士高校的 SWITCHdrive:
https://drive.switch.ch/index.php/s/EIVup04qkSHb54j

  • Windows:提供普通版 + CUDA 加速版(需 NVIDIA 显卡 ≥6GB VRAM)
  • macOS:Apple Silicon(M1–M4)有 0.7 版;Intel Mac 目前建议用 0.6
  • Linux:提供 CPU / CUDA 可执行文件,也可从源码安装

注意

  • 安装包较大(包含 AI 模型,几 GB)
  • 1 小时访谈可能需要 1–3 小时处理(取决于硬件)
  • 音频质量差或噪音大会明显影响准确率
  • 自动转录永远需要人工校对

技术基础

  • Whisper(OpenAI)+ faster-whisper
  • pyannote.audio(说话人分离)
  • 自带编辑器 noScribeEdit

适合谁用?

  • 做质性研究、访谈分析的社会科学研究者
  • 需要处理大量采访录音的记者
  • 重视数据隐私、不想把录音上传到商业云服务的人
  • 希望有图形界面 + 说话人分离 + 方便校对编辑器的用户

总结:noScribe 是目前自托管、本地运行的访谈转录工具中体验较好的一款,尤其在说话人分离和编辑器配套上做得比较用心。虽然处理速度取决于硬件,但完全离线、开源免费是它的核心优势。