Vocalinux:Linux 桌面语音转文字,开源 + 离线 + 多引擎

打开电脑想回一封邮件,脑子里想得很顺,手却在键盘上敲得很慢。Mac 有自带听写、Windows 按 Win+H 也能开口成章,唯独 Linux 桌面多年来一直缺这块。Vocalinux 就是来填这个坑的:免费、开源、模型下载完之后 100% 离线,能在 X 11 与 Wayland 下把说话声变成文字塞进当前光标位置——终端、浏览器、IDE、Office、剪贴板,全都接得住。

这是什么

Vocalinux 由 VocaHQ 出品,是一个面向 Linux 桌面的开源软件,定位明确:「Voice-to-text for Linux, finally done right.」它在 GNOME 系统托盘常驻一颗麦克风图标,默认按住右 Alt 开始说话、抬起停止,松开瞬间文字就进了焦点窗口的输入框,附带「delete that」这样的命令可以直接退格改错。最新版本是 v 0.16.1(2026-08-30 发布),许可证为 AGPL-3.0,仓库已有 792 颗 Star、84 次 Fork、55 个 Open Issue(统计截至 2026-09-02 GitHub API 时刻),代码 471 次提交,默认分支 main,语言 Python(用 GTK/PyGObject 做界面,辅以 xdotool / ydotool / wl-copy 做文本注入)。

需要强调的是:它和 macOS 自带听写/Windows Voice Typing 一样,是系统级的语音输入层,和「另一种输入法」放在同一个语义层。这意味着无需逐个应用适配——任何能接收键盘输入的应用都能用,对终端、IDE、slack、浏览器地址栏、Notion 网页都一致生效。

四种引擎

Vocalinux 把「用什么模型推理」做成可换的引擎槽位,让不同机器、不同隐私偏好都有得选:

引擎适用场景模型大小安装耗时
whisper.cpp(默认)通用桌面,C++ 高性能,Vulkan 自动加速 AMD/Intel/NVIDIA 显卡~74 MB1–2 分钟
OpenAI WhisperNVIDIA GPU 玩家走 CUDA 路径,VAD 始终在本地与 OpenAI 同源5–10 分钟
VOSK4 GB RAM 老机器,纯 CPU 推理友好~40 MB几分钟
远程 API把音频外传给自建的 OpenAI 兼容服务器,桌面侧接管渲染与快捷键远端决定即时

四种引擎共享同一套快捷键、托盘、设置面板与文本注入路径。要效率提升又不想听写时被本机风扇吹飞,首选就是 whisper.cpp tiny:要稳、要准、不信任本机算力时换远程 API;要兼容老平台就 VOSK。引擎的存储路径在 ~/.local/share/vocalinux,Flatpak 下落在 ~/.var/app/<app-id>,模型删除与重新下载都进 Settings → Speech Engine 完成。

对每一台机器,install.sh 都会做一次轻量硬件检测:识别 GPU、Vulkan 与 RAM,给出推荐引擎。如果只想要「最快跑起来」,不用看任何参数,跑默认命令就行:本地AI 的关键不在模型本身,而在「数据不出机器」这条规则上——Vocalinux 在安装器与运行下载器中都对模型做 sha 256/md 5 摘要固定校验,校验失败就放弃加载;语音数据始终只在本机磁盘上活动。

安装与卸载

绝大多数桌面发行版都支持一条命令装好。打开终端粘贴下面这一行,install.sh 会以交互方式探测硬件、选择引擎与下载模型:

AppImage 路径适合不想跑安装脚本的人:到 Releases 页 下载 Vocalinux-0.16.1-x86_64.AppImage(约 107 MB)或 aarch 64 版本(arm 笔电,约 99 MB),双击即可启动;这一版基于 Ubuntu 22.04 pinned 镜像构建 glibc 基线,Debian 12 及更新发行版都可运行。Arch 用户走 yay -S vocalinux,AUR 包已就绪。

卸载同样干净——仓库根目录有现成的脚本:

卸载会撤回 ~/.local/share/vocalinux 下的模型与配置、删除用户级 systemd 启动项与 udev 规则,不动系统其它东西。对使用技巧来说,「装上就跑、不行就卸」是值得反复确认的工具推荐项。

日常使用

Vocalinux 内置两条激活路径:

  • 按住说话 PTT(默认):按住右 Alt,说话,松开立即转录。触发行不挡普通编辑操作,松开瞬间录音停止,故对长段输入特别顺。
  • 切换 Toggle(可改键):按一次快捷键开始录音,再按一次结束,适合边说边操作鼠标。

Settings → Shortcuts 可以把按键改成 Cmd/Ctrl/自定义组合,Settings → General 还能勾选「登录时启动」「缺失模型时弹通知」等。安装完第一次启动,托盘图标呈现「待命」状态;在任意输入框聚焦,按下右 Alt、说一段话、抬手——几秒内文字就到了原位。GNOME 49 Wayland 会话下,用 ydotool 走 uinput 内核模块注入,所以即便合成器不支持虚拟键盘协议(GNOME/Mutter 历史上不直接支持),也能稳定投递按键事件;X 11/XWayland 与 IBus 路径则走 xdotoolIBus.Engine.commit_text()

install.sh --engine=whisper 安装 CUDA 路径会拉 PyTorch 与 CUDA Toolkit,大约多吃几 GB 磁盘与十分钟,首次构建后实质是「效率工具 + AI生产力」的组合——开过一次就不再重做;后续一切在本地并发运行。

我的使用感受

我日常在 Wayland 下用 GNOME,v 0.16 系列里默认快捷键改成了右 Alt,正中我这种「不想为听写单独腾一个键位」的需求。打开 settings 把识别语言切到中文(US/UK 等多语言同样支持),按住右 Alt 说一段「今晚七点开会、议题是 X」,松开瞬间一整段便签就在浏览器 Notion 的当前块;切到终端按右 Alt 复述一条命令,Ctrl+Shift+V 粘贴即可。本地 whisper.cpp tiny 在 16 GB 内存的笔电上几乎感觉不到卡顿。

更难得的是它的「数据对外」边界卡得死:官方文档写明,「Models are downloaded once. After that, speech-to-text stays on your machine.」我打开仓库翻了一次 config/src/vocalinux/audio/src/vocalinux/transcription/ 三处涉及的外部 HTTP 调用,只有首次模型下载与 Settings → About 的 GitHub 更新检查两个出口,没有发现任何把上传音频到 Voca 云的路径;whisper.cpp 与 VOSK 是典型离线引擎,远程 API 引擎只有在用户自行填写服务器 URL 之后才会被启用。这一点对在意本地AI 与隐私的项目是关键加分项。

实用层面的两点小提醒:

(1) 用 PipeWire 与复杂路由时,建议 Settings → Audio 手工选麦克风并观察电平条,比 PyAudio 自动选择稳;

(2) v0.16.1 在 0.16 系列里是稳定性补丁,IBus 路径下 GNOME Wayland 与 X 11 的行为已经拉齐,老版本可能存在的托盘卡住或转录残留问题不会出现。建议新装就直接上 v 0.16.1。

适用与不适用

Vocalinux 是为开源软件工具生态填一块空白——它对 Linux 桌面听写这一具体场景做得透彻,对其它操作系统用户意义不大。如果工作流可以在 macOS 自带 Dictation、Windows Voice Typing 或在线 Whisper 工具上完成,不必硬迁;如果工作和 Linux 桌面深度绑定、需要一段不被外传到云端的口述输入、希望用本地 GPU 推理换更准的转写,那这正是它面向这种场景的位置,也是本期把它放到 AI工具实用软件 两个栏目下的原因。

官方网站

https://github.com/VocaHQ/vocalinux

https://vocalinux.com

下载地址

https://pan.quark.cn/s/0b1bcebf7a8c

相关推荐

Avatar photo

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。