
语音输入已经成为提升效率的重要方式,但很多语音输入工具依赖云端服务,用户需要联网才能使用,同时也会面临隐私、延迟以及数据安全等问题。
而 软件格律诗 推荐的 CapsWriter-Offline 提供了一种不同的选择。
CapsWriter-Offline 是一款专为 Windows 打造的完全离线语音输入工具,它通过本地语音识别模型完成语音转文字,不依赖云端服务。用户只需要按住 CapsLock 键或者鼠标侧键 X2 开始说话,松开按键后,识别出的文字就会自动输入到当前光标所在位置。
它追求的是一种接近“无感输入”的体验:不用切换窗口,不需要复制粘贴,只需要像和电脑说话一样,就能完成文字输入。项目强调完全离线、不受网络限制、低延迟以及高度自定义热词系统,让语音输入更加贴近日常工作流。

核心功能特点:从语音输入到完整语音工作流
- 语音输入:按住
CapsLock键或鼠标侧键X2说话,松开即输入,超低延迟,默认去除末尾逗句号。支持对讲机模式和单击录音模式。 - 文件转录:音视频文件往客户端 exe 一丢,字幕 (
.srt)、文本 (.txt)、时间戳 (.json) 统统都有。 - 数字 ITN:自动将「十五六个」转为「15~16 个」,支持各种复杂数字格式。
- 热词替换:在
hot.txt记下偏僻词,通过音素模糊匹配,相似度大于阈值则强制替换。 - 正则替换:在
hot-rule.txt用正则或简单等号规则,精准强制替换。 - LLM 角色:预置了润色、小助理等角色,当识别结果的开头匹配任一角色名字时,将交由该角色处理。
- 托盘菜单:右键托盘图标即可添加热词、复制结果、清除 LLM 记忆。
- C/S 架构:服务端与客户端分离,虽然 Win 7 老电脑跑不了服务端模型,但最少能用客户端输入。
- 日记归档:按日期保存你的每一句语音及其识别结果。
- 录音保存:所有语音均保存为本地音频文件,隐私安全,永不丢失。
按住即说,松开即输入
CapsWriter-Offline 最核心的功能就是实时语音输入。
它支持两种触发方式:
使用键盘 CapsLock 键;使用鼠标侧键 X2。
用户按住按键后开始讲话,松开后程序自动完成识别并将文字输入到当前应用中,同时默认会去除末尾逗号、句号等标点,让输出更加符合连续输入习惯。除此之外,它还支持对讲机模式和单击录音模式,适应不同使用场景。
这种交互方式非常适合:
写文章;聊天回复;整理笔记;会议记录;快速输入长文本。
相比传统键盘输入,语音输入能够明显降低双手操作压力。
支持音视频文件转录
除了实时语音输入,CapsWriter-Offline 还支持文件转录功能。
用户可以直接将音视频文件拖入客户端 exe,程序会自动生成:
字幕文件 .srt;文本文件 .txt;带时间戳的数据文件 .json。
这个功能对于视频创作者、播客整理、课程笔记制作等场景非常实用,可以将已有音视频内容快速转换成文字资料。
如果需要使用文件转录功能,还需要安装 FFmpeg,并确保其位于系统 PATH 中。
多种语音识别模型选择
CapsWriter-Offline 支持多种语音识别引擎,用户可以根据准确率、速度以及硬件条件选择合适模型。
目前支持:
| 引擎 | 准确性 | 速度 | 格式 | 显卡加速 |
|---|---|---|---|---|
| Paraformer | ★★★☆☆ | ★★★★★ | ONNX | ❌ |
| SenseVoice-Small | ★★★☆☆ | ★★★★★ | ONNX | ✅ |
| Fun-ASR-Nano | ★★★★☆ | ★★★★☆ | ONNX + GGUF | ✅ |
| Qwen 3-ASR | ★★★★★ | ★★★☆☆ | ONNX + GGUF | ✅ |
不同模型适合不同需求:
如果更关注速度,可以选择轻量模型;如果更关注识别准确率,可以选择更强模型;
如果拥有显卡,则可以利用 GPU 加速提升处理效率。
低延迟本地识别体验
CapsWriter-Offline 在 README 中提供了不同模型的性能参考,以 20 秒音频转录延迟作为测试指标:
在 CPU U 9-285 H 环境下:
Paraformer 延迟约 0.6 秒;
SenseVoice-Small 延迟约 0.6 秒;
Fun-ASR-Nano 延迟约 2 秒;
Qwen 3-ASR-1.7 B 延迟约 4 秒。
在 RTX 5050 GPU 环境下:
SenseVoice-Small 可达到约 0.15 秒;
Fun-ASR-Nano 约 0.5 秒;
Qwen 3-ASR-1.7 B 约 1 秒。
这样的本地响应速度,让语音输入更接近实时交流体验。
热词替换与自定义优化
对于专业用户来说,普通语音识别经常会遇到专有名词识别错误的问题。
CapsWriter-Offline 提供热词系统。
用户可以在 hot.txt 中添加特殊词汇,程序会通过音素模糊匹配,当相似度超过设定阈值后自动强制替换。
专业软件名称;人名;公司名称;技术术语。
都可以通过热词配置提高识别准确率。
此外,它还支持正则替换功能,可以在 hot-rule.txt 中使用正则表达式或简单等号规则,实现精准替换。
数字 ITN 智能转换
CapsWriter-Offline 支持数字 ITN 功能。
语音输入:
“十五六个”
可以自动转换为:
“15~16 个”。
同时支持复杂数字格式处理。
这对于写作、数据记录以及办公输入场景非常方便。
LLM 角色辅助处理
项目还加入了 LLM 角色功能。
程序预置了润色、小助理等角色,当识别结果开头匹配某个角色名称时,会交由对应角色进行处理。
输入一段语音草稿;
调用润色角色;
获得更加适合发布的文本。
这让 CapsWriter-Offline 从单纯语音输入工具进一步扩展为语音创作助手。
本地保存录音与日记归档
隐私保护也是 CapsWriter-Offline 的重要特点。
所有语音都会保存为本地音频文件,不上传云端。
同时,它支持按照日期保存每一句语音以及对应识别结果,形成语音日记归档。
对于重视数据安全的用户,这种本地保存方式更加安心。
使用教程:如何安装并开始语音输入
第一步:准备运行环境
CapsWriter-Offline 目前主要保证在 Windows 10/11 64 位系统下运行。
首先需要安装 VC++ 运行库。
如果需要文件转录功能,还需要安装 FFmpeg。
第二步:下载程序和模型
下载软件主体。
随后进入 Models Release 下载模型压缩包,将模型解压到对应的 models 文件夹中。
第三步:启动服务
依次运行:
start_server.exe
start_client.exe
服务端启动后会自动最小化到托盘菜单,客户端启动后同样会进入托盘运行状态。
第四步:开始语音输入
打开任意可以输入文字的软件
浏览器;Word;聊天窗口;Markdown 编辑器。
将光标放在输入位置,然后:
按住 CapsLock;或者按住鼠标侧键 X 2;
开始讲话。松开按键后,文字会自动出现。
我的使用感受
体验 CapsWriter-Offline 后,我认为它最大的特点是把语音输入真正变成了电脑输入方式的一部分。
很多语音工具的问题在于,它们需要打开专门窗口,完成识别后再复制文本,而 CapsWriter-Offline 的交互更加直接:哪里需要输入,就在哪里说。
这种设计尤其适合长文本创作。
例如写文章时,很多想法来自即时表达,键盘输入容易打断思路,而语音输入可以让创作过程更加自然。
另外,完全离线也是我比较看重的一点。对于一些包含个人资料、工作内容或者敏感信息的输入场景,本地处理能够减少数据上传带来的顾虑。
它目前主要面向 Windows 用户,macOS 由于底层 keyboard 库以及系统限制暂时无法支持。
如果你的主要设备是 Windows,并且经常需要输入大量文字,CapsWriter-Offline 是一个非常值得尝试的效率工具。
总结:让语音成为电脑输入的新方式
CapsWriter-Offline 是一款专注本地语音输入体验的 Windows 工具。
它通过离线语音识别、多模型支持、热词系统、文件转录、LLM 角色处理以及本地录音归档等功能,构建了一套完整的语音工作流。
它追求的并不是简单替代键盘,而是让用户拥有一种更加自然、高效、安全的电脑输入方式。
对于写作者、开发者、办公用户以及任何需要大量文字输入的人来说,CapsWriter-Offline 都提供了一种值得探索的新选择。
本文来自 格物致知 · 科技发现周刊 004期:GTA(15个项目)
官方网站
https://github.com/HaujetZhao/CapsWriter-Offline
下载地址
https://pan.quark.cn/s/de20a915f2d3




