官方仓库:https://github.com/harry0703/AudioNotes

AudioNotes 是一款完全本地运行的音视频转文字 + 智能笔记工具,特别适合整理会议、访谈、课程、播客、语音备忘录等内容。

它能快速把音视频转成文字稿,再用大模型整理成结构清晰的 Markdown 笔记,并支持基于内容继续提问对话。

核心特点

  • 本地优先 & 隐私安全

    • 语音识别用 FunASR(本地)
    • 笔记整理与问答用 Ollama 本地大模型
    • 音视频、文字稿、笔记、对话历史全部保存在本机
    • 默认不发送内容到任何第三方 AI 接口
    • Web 界面默认只监听本机(127.0.0.1),不对外开放
  • 主要功能

    • 上传音频/视频,自动生成文字稿
    • 自动整理成结构化 Markdown 笔记
    • 基于内容继续提问(问答)
    • 支持浏览器直接录音
    • 支持领域热词(提高专业词汇识别率)
    • 对话历史管理
  • 默认模型

    • 语音识别:FunAudioLLM/Fun-ASR-Nano-2512(约 2.15GB,首次自动下载)
    • 笔记整理与问答:qwen3.5:2b(通过 Ollama)

快速部署教程(推荐 Docker 方式)

前置要求

  1. 安装并启动 Docker Desktop(建议分配至少 12GB 内存,处理长音频推荐 16GB
  2. 安装并启动 Ollamahttps://ollama.com/download)

1. 准备本地大模型

1
ollama pull qwen3.5:2b

2. 下载并启动 AudioNotes

1
2
3
4
5
6
7
8
9
mkdir audionotes
cd audionotes

# 下载配置文件
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env

# 启动服务
docker compose up -d --remove-orphans

3. 访问使用

浏览器打开:http://localhost:15433/

默认账号 / 密码:admin / admin

首次识别会自动下载约 2.15GB 的语音模型,下载完成后会保存在本地,后续无需重复下载。


从源码启动(可选)

需要准备:

  • Python 3.12
  • ffmpeg
  • Ollama
1
2
3
4
5
6
7
8
9
10
11
12
13
git clone https://github.com/harry0703/AudioNotes.git
cd AudioNotes

python3.12 -m venv .venv
source .venv/bin/activate # Windows 使用 .venv\Scripts\activate

python -m pip install -r requirements.txt
cp .env.example .env

ollama pull qwen3.5:2b

# 启动
python -m chainlit run main.py --host 127.0.0.1 --port 15433

同样访问 http://localhost:15433/


使用方法

  1. 登录后上传音频或视频(或直接浏览器录音)
  2. 等待语音识别 + 笔记整理完成
  3. 查看完整文字稿和结构化 Markdown 笔记
  4. 在输入框继续提问(如“谁负责?”“主要结论是什么?”)
  5. 左侧可查看历史记录

数据管理与常用命令

  • 数据位置(Docker):整个 audionotes 文件夹(上传文件、模型缓存、日志、对话历史都在这里)
  • 备份:停止服务后直接复制整个文件夹
  • 停止服务
    1
    docker compose down
  • 重启
    1
    docker compose up -d
  • 更新到最新版
    1
    2
    docker compose pull
    docker compose up -d --remove-orphans

可选配置

  • 修改登录账号密码:编辑 .env 中的 USERNAMEPASSWORD
  • 支持更多语言识别:将 .env 中的 ASR_MODEL 改为 FunAudioLLM/Fun-ASR-MLT-Nano-2512
  • Linux + NVIDIA 显卡加速:使用 docker-compose.gpu.yml

常见问题

问题 解决方法
页面打不开 确认 Docker Desktop 和 Ollama 都已启动,执行 docker compose psdocker compose logs -f webui 查看日志
找不到模型 重新执行 ollama pull qwen3.5:2b
长音频处理中断 增加 Docker 内存配额(推荐 16GB)
多人共用电脑 务必修改默认 admin/admin 密码

总结:AudioNotes 是目前少有的真正本地、隐私友好的音视频笔记工具,特别适合不想把公司会议或私人录音上传到云端的用户。部署简单,效果实用。

需要我补充 GPU 加速详细步骤、热词配置方法,或其他具体问题吗?