AudioNotes:本地优先的音视频转结构化 Markdown 笔记工具
官方仓库:https://github.com/harry0703/AudioNotes
AudioNotes 是一款完全本地运行的音视频转文字 + 智能笔记工具,特别适合整理会议、访谈、课程、播客、语音备忘录等内容。
它能快速把音视频转成文字稿,再用大模型整理成结构清晰的 Markdown 笔记,并支持基于内容继续提问对话。
核心特点
本地优先 & 隐私安全
- 语音识别用 FunASR(本地)
- 笔记整理与问答用 Ollama 本地大模型
- 音视频、文字稿、笔记、对话历史全部保存在本机
- 默认不发送内容到任何第三方 AI 接口
- Web 界面默认只监听本机(127.0.0.1),不对外开放
主要功能
- 上传音频/视频,自动生成文字稿
- 自动整理成结构化 Markdown 笔记
- 基于内容继续提问(问答)
- 支持浏览器直接录音
- 支持领域热词(提高专业词汇识别率)
- 对话历史管理
默认模型
- 语音识别:
FunAudioLLM/Fun-ASR-Nano-2512(约 2.15GB,首次自动下载) - 笔记整理与问答:
qwen3.5:2b(通过 Ollama)
- 语音识别:
快速部署教程(推荐 Docker 方式)
前置要求
- 安装并启动 Docker Desktop(建议分配至少 12GB 内存,处理长音频推荐 16GB)
- 安装并启动 Ollama(https://ollama.com/download)
1. 准备本地大模型
1 | ollama pull qwen3.5:2b |
2. 下载并启动 AudioNotes
1 | mkdir audionotes |
3. 访问使用
浏览器打开:http://localhost:15433/
默认账号 / 密码:admin / admin
首次识别会自动下载约 2.15GB 的语音模型,下载完成后会保存在本地,后续无需重复下载。
从源码启动(可选)
需要准备:
- Python 3.12
- ffmpeg
- Ollama
1 | git clone https://github.com/harry0703/AudioNotes.git |
使用方法
- 登录后上传音频或视频(或直接浏览器录音)
- 等待语音识别 + 笔记整理完成
- 查看完整文字稿和结构化 Markdown 笔记
- 在输入框继续提问(如“谁负责?”“主要结论是什么?”)
- 左侧可查看历史记录
数据管理与常用命令
- 数据位置(Docker):整个
audionotes文件夹(上传文件、模型缓存、日志、对话历史都在这里) - 备份:停止服务后直接复制整个文件夹
- 停止服务:
1
docker compose down
- 重启:
1
docker compose up -d
- 更新到最新版:
1
2docker compose pull
docker compose up -d --remove-orphans
可选配置
- 修改登录账号密码:编辑
.env中的USERNAME和PASSWORD - 支持更多语言识别:将
.env中的ASR_MODEL改为FunAudioLLM/Fun-ASR-MLT-Nano-2512 - Linux + NVIDIA 显卡加速:使用
docker-compose.gpu.yml
常见问题
| 问题 | 解决方法 |
|---|---|
| 页面打不开 | 确认 Docker Desktop 和 Ollama 都已启动,执行 docker compose ps 和 docker compose logs -f webui 查看日志 |
| 找不到模型 | 重新执行 ollama pull qwen3.5:2b |
| 长音频处理中断 | 增加 Docker 内存配额(推荐 16GB) |
| 多人共用电脑 | 务必修改默认 admin/admin 密码 |
总结:AudioNotes 是目前少有的真正本地、隐私友好的音视频笔记工具,特别适合不想把公司会议或私人录音上传到云端的用户。部署简单,效果实用。
需要我补充 GPU 加速详细步骤、热词配置方法,或其他具体问题吗?
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 极客的赛博空间 | 专注 AI 与技术分享!
评论









