
打开电脑想回一封邮件,脑子里想得很顺,手却在键盘上敲得很慢。Mac 有自带听写、Windows 按 Win+H 也能开口成章,唯独 Linux 桌面多年来一直缺这块。Vocalinux 就是来填这个坑的:免费、开源、模型下载完之后 100% 离线,能在 X 11 与 Wayland 下把说话声变成文字塞进当前光标位置——终端、浏览器、IDE、Office、剪贴板,全都接得住。

这是什么
Vocalinux 由 VocaHQ 出品,是一个面向 Linux 桌面的开源软件,定位明确:「Voice-to-text for Linux, finally done right.」它在 GNOME 系统托盘常驻一颗麦克风图标,默认按住右 Alt 开始说话、抬起停止,松开瞬间文字就进了焦点窗口的输入框,附带「delete that」这样的命令可以直接退格改错。最新版本是 v 0.16.1(2026-08-30 发布),许可证为 AGPL-3.0,仓库已有 792 颗 Star、84 次 Fork、55 个 Open Issue(统计截至 2026-09-02 GitHub API 时刻),代码 471 次提交,默认分支 main,语言 Python(用 GTK/PyGObject 做界面,辅以 xdotool / ydotool / wl-copy 做文本注入)。
需要强调的是:它和 macOS 自带听写/Windows Voice Typing 一样,是系统级的语音输入层,和「另一种输入法」放在同一个语义层。这意味着无需逐个应用适配——任何能接收键盘输入的应用都能用,对终端、IDE、slack、浏览器地址栏、Notion 网页都一致生效。

四种引擎
Vocalinux 把「用什么模型推理」做成可换的引擎槽位,让不同机器、不同隐私偏好都有得选:
| 引擎 | 适用场景 | 模型大小 | 安装耗时 |
| whisper.cpp(默认) | 通用桌面,C++ 高性能,Vulkan 自动加速 AMD/Intel/NVIDIA 显卡 | ~74 MB | 1–2 分钟 |
| OpenAI Whisper | NVIDIA GPU 玩家走 CUDA 路径,VAD 始终在本地 | 与 OpenAI 同源 | 5–10 分钟 |
| VOSK | 4 GB RAM 老机器,纯 CPU 推理友好 | ~40 MB | 几分钟 |
| 远程 API | 把音频外传给自建的 OpenAI 兼容服务器,桌面侧接管渲染与快捷键 | 远端决定 | 即时 |
四种引擎共享同一套快捷键、托盘、设置面板与文本注入路径。要效率提升又不想听写时被本机风扇吹飞,首选就是 whisper.cpp tiny:要稳、要准、不信任本机算力时换远程 API;要兼容老平台就 VOSK。引擎的存储路径在 ~/.local/share/vocalinux,Flatpak 下落在 ~/.var/app/<app-id>,模型删除与重新下载都进 Settings → Speech Engine 完成。
对每一台机器,install.sh 都会做一次轻量硬件检测:识别 GPU、Vulkan 与 RAM,给出推荐引擎。如果只想要「最快跑起来」,不用看任何参数,跑默认命令就行:本地AI 的关键不在模型本身,而在「数据不出机器」这条规则上——Vocalinux 在安装器与运行下载器中都对模型做 sha 256/md 5 摘要固定校验,校验失败就放弃加载;语音数据始终只在本机磁盘上活动。

安装与卸载
绝大多数桌面发行版都支持一条命令装好。打开终端粘贴下面这一行,install.sh 会以交互方式探测硬件、选择引擎与下载模型:
AppImage 路径适合不想跑安装脚本的人:到 Releases 页 下载 Vocalinux-0.16.1-x86_64.AppImage(约 107 MB)或 aarch 64 版本(arm 笔电,约 99 MB),双击即可启动;这一版基于 Ubuntu 22.04 pinned 镜像构建 glibc 基线,Debian 12 及更新发行版都可运行。Arch 用户走 yay -S vocalinux,AUR 包已就绪。
卸载同样干净——仓库根目录有现成的脚本:
卸载会撤回 ~/.local/share/vocalinux 下的模型与配置、删除用户级 systemd 启动项与 udev 规则,不动系统其它东西。对使用技巧来说,「装上就跑、不行就卸」是值得反复确认的工具推荐项。

日常使用
Vocalinux 内置两条激活路径:
- 按住说话 PTT(默认):按住右 Alt,说话,松开立即转录。触发行不挡普通编辑操作,松开瞬间录音停止,故对长段输入特别顺。
- 切换 Toggle(可改键):按一次快捷键开始录音,再按一次结束,适合边说边操作鼠标。
Settings → Shortcuts 可以把按键改成 Cmd/Ctrl/自定义组合,Settings → General 还能勾选「登录时启动」「缺失模型时弹通知」等。安装完第一次启动,托盘图标呈现「待命」状态;在任意输入框聚焦,按下右 Alt、说一段话、抬手——几秒内文字就到了原位。GNOME 49 Wayland 会话下,用 ydotool 走 uinput 内核模块注入,所以即便合成器不支持虚拟键盘协议(GNOME/Mutter 历史上不直接支持),也能稳定投递按键事件;X 11/XWayland 与 IBus 路径则走 xdotool 与 IBus.Engine.commit_text()。
install.sh --engine=whisper 安装 CUDA 路径会拉 PyTorch 与 CUDA Toolkit,大约多吃几 GB 磁盘与十分钟,首次构建后实质是「效率工具 + AI生产力」的组合——开过一次就不再重做;后续一切在本地并发运行。

我的使用感受
我日常在 Wayland 下用 GNOME,v 0.16 系列里默认快捷键改成了右 Alt,正中我这种「不想为听写单独腾一个键位」的需求。打开 settings 把识别语言切到中文(US/UK 等多语言同样支持),按住右 Alt 说一段「今晚七点开会、议题是 X」,松开瞬间一整段便签就在浏览器 Notion 的当前块;切到终端按右 Alt 复述一条命令,Ctrl+Shift+V 粘贴即可。本地 whisper.cpp tiny 在 16 GB 内存的笔电上几乎感觉不到卡顿。
更难得的是它的「数据对外」边界卡得死:官方文档写明,「Models are downloaded once. After that, speech-to-text stays on your machine.」我打开仓库翻了一次 config/、src/vocalinux/audio/、src/vocalinux/transcription/ 三处涉及的外部 HTTP 调用,只有首次模型下载与 Settings → About 的 GitHub 更新检查两个出口,没有发现任何把上传音频到 Voca 云的路径;whisper.cpp 与 VOSK 是典型离线引擎,远程 API 引擎只有在用户自行填写服务器 URL 之后才会被启用。这一点对在意本地AI 与隐私的项目是关键加分项。
实用层面的两点小提醒:
(1) 用 PipeWire 与复杂路由时,建议 Settings → Audio 手工选麦克风并观察电平条,比 PyAudio 自动选择稳;
(2) v0.16.1 在 0.16 系列里是稳定性补丁,IBus 路径下 GNOME Wayland 与 X 11 的行为已经拉齐,老版本可能存在的托盘卡住或转录残留问题不会出现。建议新装就直接上 v 0.16.1。

适用与不适用
Vocalinux 是为开源的软件工具生态填一块空白——它对 Linux 桌面听写这一具体场景做得透彻,对其它操作系统用户意义不大。如果工作流可以在 macOS 自带 Dictation、Windows Voice Typing 或在线 Whisper 工具上完成,不必硬迁;如果工作和 Linux 桌面深度绑定、需要一段不被外传到云端的口述输入、希望用本地 GPU 推理换更准的转写,那这正是它面向这种场景的位置,也是本期把它放到 AI工具 与实用软件 两个栏目下的原因。
官方网站
https://github.com/VocaHQ/vocalinux
下载地址
https://pan.quark.cn/s/0b1bcebf7a8c







