OneAsr — 本地离线批量音视频转 SRT 字幕,Qwen3-ASR 加词级对齐,不上传云端

OneAsr 是一个开源的软件工具,在本地把音频和视频批量转成 SRT 或 TXT 字幕。它基于 Qwen3-ASR 加 ForcedAligner,Windows、Linux、macOS 都有包,转写和对齐全程在你机器上跑。作为一个开源软件,除了首次从 ModelScope 下载模型需要联网,之后完全离线。

场景痛点

给视频加字幕这件事,在线工具都一个德行:把音频传到人家服务器上,按分钟计费,转完时间轴还是整段整段的猜,对不上口型。更别扭的是录的是访谈、会议、内部素材,根本不放心传到云上。做视频处理的人都有这种矛盾:想要字幕准,又不想把素材交出去。

主要功能特点

  • 完全本地:转写与对齐都在本机,下完模型可断网用
  • 批量队列:一次丢多个文件,进度与阶段一目了然
  • 时间轴可靠:ForcedAligner 词级对齐 + 智能断句,不是整段估时间
  • 11 种语言:中文普通话、English、粤语、日本語、한국어、Français、Deutsch、Italiano、Español、Português、Русский(需手动指定,不自动检测)
  • 双规格 ASR:0.6B(更快 / 省显存)· 1.7B(更准 / 更吃资源)
  • 输出可选:SRT / TXT 可同时选,默认与视频同目录
  • 简繁可选:原文 / 简体 / 繁体(仅中文、粤语生效,不影响时间轴)
  • 人声分离(可选):内置 HTDemucs v4,带 BGM / 噪声时先压掉背景音
  • GPU 加速:NVIDIA / AMD / Intel / Mac M 芯片;无独显自动走 CPU

本地离线,不上传云端

转写和对齐都在本机完成,模型下好之后拔网线照样跑。访谈、会议、内部培训这类不能外传的素材,终于可以安心理直气壮地跑字幕。这种把本地AI模型真正跑在自己机器上的做法,比把音频丢给云 API 踏实。

词级对齐,时间轴准

不是整段猜时间,而是 ForcedAligner 做词级对齐,再智能断句。字幕和口型对得上,不用你在时间轴上手动拉半天。这一点是它和那些「整段一句话扔进去、给个大概时间」的在线工具最大的差别。

批量队列,丢进去就不管

一次拖一堆文件进来,进度和当前阶段始终可见。转写长片、批量处理课程录像、播客切片段,都不用守在旁边。作为桌面软件,它把「一次转一条」做成了队列。

11 种语言,中英繁简可选

支持中文普通话、粤语、英语、日语、韩语、法、德、意、西、葡、俄 11 种源语言(手动指定,不自动检测)。中文和粤语还能选原始字形、简体、繁体。做自媒体切多语言版本的人,这个覆盖够用。

人声分离,压着 BGM 也能转

内置 HTDemucs v4,转写前先把背景音和人声拆开。背景音乐吵、环境噪音大的素材,开了人声分离再转,准确率明显上一个台阶。

双模型尺寸,GPU 自动加速

Qwen3-ASR 有 0.6B(快、显存小)和 1.7B(准、吃资源)两档;NVIDIA、AMD、Intel、Apple Silicon 都能 GPU 加速,没独显自动退到 CPU。ffmpeg 已经打包进每个 release,不用自己配。在跨平台应用这条线上,Windows、macOS Apple Silicon、Linux 都有安装包。

简易使用教程

在实用软件里,它属于「装完下模型就能用」那一挂:

  • 去 Release 页下对应平台的安装包或便携版(Windows 有 Installer 和 Portable,Linux 有 .deb 和 tar.gz,macOS 是 DMG)。
  • 首次打开进 Settings,下载 ASR 模型(推荐先 0.6B)和 ForcedAligner(必装),模型从 ModelScope 断点续传。
  • 选源语言(粤语记得选「粤语」,别选成普通话),拖音视频文件进队列,点开始。
  • 输出默认 SRT 和 TXT,存在视频同目录下;中文字形可选原始/简体/繁体。
  • 命令行党用 oneasr-cli transcribe –input video.mp4 –language zh –output out.srt。

安装包不含权重,首次在设置里从 ModelScope 下载(可断点续传):

组件约体积说明
Qwen3-ASR-0.6B-hf~1.6 GB默认推荐
Qwen3-ASR-1.7B-hf~4.1 GB更高精度
Qwen3-ForcedAligner-0.6B-hf~1.8 GB必需,所有 ASR 共用
HTDemucs v4 人声权重~84 MB可选

个人使用感受

我用下来最直接的感受是「终于不用把素材传出去了」。以前转访谈视频字幕,要么用云 API 按分钟付费,要么用开源方案但要配 Python 环境;OneAsr 装好、下个模型,拖文件进去就跑,词级对齐出来的时间轴比我手动拉的还准。人声分离这个功能也实用——我那个压着 BGM 的播客片段,开了分离之后识别错字率明显降下来。

也得说清它的门槛:模型不小(0.6B 约 1.6GB,加对齐器和人声模型总共 3.5–6GB),第一次下载要等;显存建议 4GB 以上跑 0.6B,没独显能跑但慢;语言要手动选,选错是最常见的失败原因;macOS 版未签名,首次打开要按说明放行。但如果你经常要给音视频加字幕、又受够了云 API 按分钟计费和上传素材的不踏实,这个把影音编辑流程整个搬到本地的开源工具,值得放进你的工具推荐清单,归在AI工具分类下。它没替你写文案,只是让你的音视频,终于能在不出这台电脑的前提下,得到一版时间轴对得上的字幕。

官方网站

GitHub https://github.com/eclipse005/OneAsr

下载地址

https://pan.quark.cn/s/62a00ee8bb66

https://www.guangyapan.com/s/1954753666950606897_aeWhI5wocgzRgCO6 (光鸭新用户注册福利:永久免费空间:所有新用户注册即可解锁 2TB 永久免费存储空间,无需额外任务或付费)

相关推荐

Avatar photo

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。