拖进音频或视频,贴上配音稿,点一下。时间轴对好,样式随便调, 导出成透明 MOV 或者直接烧进画面。
| macOS | 只支持 Apple 芯片的 Mac(M1 / M2 / M3 / M4),macOS 11 Big Sur 及以上。 Intel 芯片的 Mac 装不了 —— 不是「功能少一点」,是根本打不开: 软件本体和识别引擎都是 Apple 芯片版,而 macOS 没有「Intel 跑 arm 程序」这回事 (Rosetta 只能反过来)。Intel 版还在做。 怎么看:点左上角 → 关于本机,「芯片」那一行写着 M 开头的就是 Apple 芯片。 |
|---|---|
| Windows | 64 位的 Windows 10 或 11。 Windows 版少一个导出格式(HEVC alpha 是 macOS 独有的编码器),其余功能一样。 |
按平台分成两个文件夹,进自己那个,前两个文件都下,另一个文件夹和你无关。 这份教程在最外层,两个平台共用。
| macOS 文件夹 | 是什么 |
|---|---|
智能字幕工具.dmg | 软件本体,约 113MB |
Subtitler-Engine-Mac.zip | 语音识别引擎,1.4GB。不用解压,软件自己会处理 |
| Windows 文件夹 | 是什么 |
智能字幕工具-安装.exe | 软件本体,约 122MB |
Subtitler-Engine-Win.zip | 语音识别引擎,1.4GB。不用解压,软件自己会处理 |
微软运行库(识别报错再装).exe | 微软 VC++ 运行库。平时不用下:只有识别时报「缺少运行库」才要装,大多数电脑早就有了 |
一键卸载.bat | 想卸载的时候再下它,装的时候用不着 |
macOS:双击 智能字幕工具.dmg,把图标拖进右边的「应用程序」。
一定要拖过去再打开 —— 留在「下载」里运行的话,系统每次都会拦,清理下载目录时还会连软件一起删掉。
第一次打开如果提示「无法验证开发者」:在「应用程序」里右键点图标 → 打开 → 再点一次「打开」。
较新的 macOS 弹窗里可能没有「打开」按钮,那就去系统设置 → 隐私与安全性,在下面点「仍要打开」。
这一步只用做一次。
Windows:双击 智能字幕工具-安装.exe,按向导下一步装完,
可以自己选安装位置,不需要管理员权限。
第一次运行大概率会弹一个蓝色窗口「Windows 已保护你的电脑」:
点左边那行小字「更多信息」,再点「仍要运行」。
这是 SmartScreen 对没买代码签名证书的软件的例行拦截,和病毒无关,只有第一次要这样。
这一步你什么都不用做。软件一打开就会在这台电脑上找那个 1.4GB 的 zip (下载、桌面、文档,各翻两层),找到了直接开装 —— 屏幕中间出来一个小窗口告诉你在干什么, 一两分钟,装完它自己关掉,软件接着开。不用解压,不用跑脚本,一次都不用点。
只有真找不到那个包时(比如你下到别的盘去了),它才会问你一句, 按钮是「我下好了,选给它」,点一下挑中那个 zip 就行; 框里还会列出它找过哪些目录。
装的过程要 3.4GB 左右的空闲空间(压缩包和解出来的文件同时在盘上),装完占约 1.6GB:
macOS 在 ~/Library/Subtitler/,Windows 在 %LOCALAPPDATA%\Subtitler。
想卸载引擎就把这个文件夹删掉。
装成了就没有任何多余的框,直接进软件。真没装成才会弹一个框写明原因 (多半是磁盘空间不够,或者那个 zip 没下完整 —— 它应该有 1.4GB 左右)。
打开软件先要用本站(sjfls6.com)的账号登录 —— 和网站是同一套账号, 不用记激活码,也不用报机器码。两种登法:
还没试用过的账号,登录后窗口里会直接出现「申请 10 天免费试用」—— 点一下就开通,不用回网站跑一趟。试用每个账号只有一次, 从点下那一刻起算 10 天,功能不阉割。
音频、视频都行 —— mp4、mov、mp3、wav、m4a 这些常见格式都认。 拖进来之后左边会显示时长和识别出的人声段数,下方时间轴上会出现波形。
把念稿子的那份文字贴进「字幕脚本」框。标点会自动去掉,长句按语义断行。 如果你自己已经分好了行,保持「我敲的换行就是一条字幕」勾着,就一行一条。
第一次要等一会儿(识别一分钟的音频大约几秒到十几秒,看模型和机器)。 之后再调断句、改参数都是秒出,不会重新识别。
右边面板管字体、填充、描边、投影、位置。改动实时反映在预览上, 而且预览就是导出结果 —— 用的是同一段渲染代码。
右上角「导出」。要拿进剪辑软件就选透明格式,直接发出去就选烧录。
左边「语音识别」那栏勾上「拖进来就直接出字幕(没贴脚本时自动识别)」, 之后拖进音频就自己往下走:识别、断句、对轴一气呵成,不用点任何按钮。 脚本框里已经贴了字的时候不会自动跑 —— 那说明你走的是有稿那条路,机器不替你做主。
这条路的时间轴照样准,但文字是识别出来的,一定有错别字 (专有名词尤其容易错,「星揆」听成「星魁」这种)。所以改错字要成批地改:
弹窗上半部是全文,一行一条、行首带编号。点「复制全文」拿走。
丢给 AI 或者在任何编辑器里改都行。交代清楚一句话: 只改错别字,保留行首编号,不要增删行、不要合并行。
它按编号逐条换文字,时间轴分毫不动,手工拆过的条也不会被重排。 编号对不上的条目会原样留着,并且明确告诉你是第几条 —— 不会把一条改到别处去。
拿 20 句中文配音测的(逐句合成再按已知停顿拼接,所以每一句的真实起止时间精确到毫秒):
| 指标 | 智能字幕工具 | 按字数均分(很多工具的做法) |
|---|---|---|
| 起点平均误差 | 21 ms | 552 ms |
| 终点平均误差 | 78 ms | 805 ms |
| 误差中位数 | 35 ms | 675 ms |
| 最差的一条 | 180 ms | 1638 ms |
| 误差在 100ms 以内的比例 | 93% | 3% |
人眼能察觉字幕和声音不同步的门槛大约是 100 毫秒。也就是说绝大多数情况下你看不出偏差, 最差的一条也只有零点一八秒。
左下角会显示一个百分比,意思是「脚本里有多少字在音频里找到了对应」。
这一条有需要留意的地方:字太多读不完(超过 9 字/秒)、停留时间太短(不到 0.6 秒), 或者这条没在音频里对上。点中它,下面的编辑框里可以直接改文字和时间。
把「填充」或「描边」的类型选成线性渐变,会同时出来两处控件:
类型一选成渐变,字幕上就直接出现一条渐变线 —— 和在 Figma 里选中图层调渐变是一回事:
角度是这么定义的:0° 水平(左→右)、90° 垂直(上→下)、
180° 水平(右→左)、270° 垂直(下→上)。就是渐变方向和水平线的夹角,顺时针。
两端圆点能拖到文字框外面,也能收进文字里 —— 后者的意思是 「渐变只在这一小段里完成,两头都是纯色」,这是光给一个角度值做不到的。
↻90 转 90°,⇄ 反转整条渐变。
转方向时渐变的长短不变,只是绕中点转过去⤢(或双击方向盘)铺满文字 —— 在画面上把手柄拖远之后,
渐变的可见段可能只剩中间一小截、看着像纯色,用它一键拉回文字框的边缘两处改的是同一条渐变,改哪边另一边都会跟着动。描边也能用渐变 —— 综艺字幕那种「金边」就是这么做的。
| 空格 | 播放 / 暂停 |
| ← → | 前后移动一帧(按住 ⇧ 是一秒) |
| ↑ ↓ | 选上一条 / 下一条字幕 |
| ⌘Z | 撤销(Windows 上是 CtrlZ) |
这份说明里写的 ⌘ 在 Windows 上一律换成 Ctrl, ⇧ 就是 Shift。
| ProRes 4444 | 最通用的透明视频格式,Premiere、达芬奇、Final Cut 都认。文件比较大,一分钟 1080p 大概 200~300 MB。不确定选什么就选它。 |
| HEVC alpha | 同样是透明视频,体积只有 ProRes 的零头。苹果生态里通用性好,Windows 侧的软件支持要看具体版本。仅 macOS 可导。 |
| QuickTime RLE | 无损透明,兼容一些老软件。文件最大。 |
| WebM VP9 | 网页上能直接播的透明视频。 |
| PNG 序列 | 什么软件都能进,也最占地方。 |
| 烧录 MP4 | 字幕压进画面,发微信、传抖音直接用。 |
| 烧录 ProRes | 同上但画质更高,适合还要再剪一道的场合。 |
| SRT | 最通用,只有文字和时间,样式一概没有。 |
| ASS | 唯一能带样式的文本格式 —— 字体、字号、颜色、描边、位置都在里面,
剪映、Premiere、播放器都认,而且导出后还能继续改。 但它表达不了渐变填充、多重描边、投影模糊,导出时会自动降级并明确告诉你降了什么。 |
| VTT | 网页 <track> 用的。 |
| LRC | 歌词格式,只有起点没有终点。 |
| 工程文件 | 把字幕和样式一起存成 JSON,以后可以接着编辑。 |
能。脚本框留空直接点「自动语音识别匹配」,它会把识别稿填进去; 勾上「拖进来就直接出字幕」连这一下都不用点。 但识别稿一定会有错字,务必自己校一遍 —— 用「校对」批量改, 见上面「没有稿子:拖进来就出字幕」那一节。 有稿子的话请一定贴稿子,结果的质量差得很远。
不会。屏幕上出现的永远是你贴进去的那份文字,识别结果只用来定位时间。 这也是为什么强烈建议贴稿子。
左边「对轴微调 → 整体提前」拉一下,正数是字幕比声音早出来。 默认提前 40 毫秒 —— 字幕稍微早一点点,观感上才是同步的。
把「每行最多」调小,或者「最多行数」改成两行。改完会自动重新对轴,不用再识别一次。 也可以选中那一条,把光标放在要断开的位置,点「拆分」。
右边面板切到「第二字幕」,勾上启用,就能给第二行单独设字体、字号和样式。 每条字幕下方会多出一个输入框,填第二语言的文字。
这台电脑缺微软的 VC++ 运行库,语音识别引擎要用它。先安装运行库再试:
网盘 Windows 文件夹里的 微软运行库(识别报错再装).exe,双击装上,重新打开本软件就好。
装一次就行,不用重装本软件。网盘下不了的话,也可以从微软官网下
vc_redist.x64.exe(x64 版)。
软件启动时发现缺运行库也会先弹框提醒。
正常。Mac(M 系列芯片)用显卡算,几分钟的配音几秒就识别完;Windows 版只用 CPU 算,会慢不少, CPU 核越多越快。在 Mac 上用虚拟机(Parallels 等)跑 Windows 版会更慢 —— 那是在模拟 x64,速度不能代表真的 Windows 电脑。
字体搜索框中英文名都能搜,繁简也通用(搜「苹方」能找到「蘋方」)。 如果确实没有,确认字体装在系统的字体目录里,然后重启一次软件重新扫描。
样式和「我的预设」会自动记住。素材、稿子和字幕要留存,用顶栏的「保存工程」
存成一个 .flssub 文件,下次「打开工程」(或者直接双击它)接着改,识别结果也在里面,不用再识别一次。
点左边那行小字「更多信息」,再点「仍要运行」就行。 这是 SmartScreen 对没买代码签名证书的软件的例行拦截 —— 一张证书一年好几千, 还要靠下载量慢慢积累信誉,小工具通常不买。只有第一次要这样。
只差一个导出格式:HEVC alpha(体积最小的透明视频)用的是 macOS 独有的 编码器,Windows 上没有。透明视频在 Windows 上走 ProRes 4444、WebM VP9 或者 PNG 序列, 对轴精度、样式、其余所有导出格式都一模一样。
不会。所有处理都在你自己的电脑上完成。软件只在打开时联一次网核授权,除此之外不联网 —— 音频、视频、文案都不会离开这台电脑。
能。软件在识别之前会先把纯音乐、长静音的段落裁掉,只把人声送去识别。 一段开场有 12 秒纯音乐的发布会配音,实测全篇匹配度 100%。
不做这一步的话,语音识别会在音乐段「幻听」,凭空吐出一整段不存在的文字, 还会连带吞掉后面十几秒真正的人声 —— 那才是「带 BGM 就对不准」的真正原因, 和音乐吵不吵关系不大。
目前还没把握的是音乐和人声重叠的段落(边放音乐边说话)。 如果手上有纯人声那一轨,用它来对轴,对好之后再回到成片上用。
软件本身好卸,麻烦的是那 1.6GB 引擎 —— 它不在软件目录里,卸载软件不会带走它。
网盘 Windows 文件夹里有个 一键卸载.bat,双击它,
按提示输入 y 回车。它会依次清掉三样:1.6GB 的语音识别引擎、
设置和登录凭据、软件本身(最后一步会拉起系统的卸载程序,
跟着点完就行)。
窗口里的提示是英文的 —— .bat 文件里只要混进一个中文字符,
cmd 的解析就会错位。看到最后一行 [OK] Done. 就是清干净了。
只想卸软件、把引擎留着(比如过阵子还要装回来)?那就走系统的
设置 → 应用 → 已安装的应用,找到「智能字幕工具」卸载。
引擎会留在 %LOCALAPPDATA%\Subtitler,重装软件后直接就能用,不用重下。
三样东西,删掉就行:
/Applications/智能字幕工具.app | 软件本体,拖进废纸篓 |
~/Library/Subtitler/ | 1.6GB 的语音识别引擎 |
~/Library/Application Support/subtitler-desktop/ | 设置和登录凭据 |
后两个在访达里按 ⇧⌘G,粘贴路径回车就能到。 同样,只想卸软件、留着引擎的话,只删第一个。
| 版本 | 0.2.16 |
|---|---|
| 发布 | 2026-09-11 |
| macOS | Apple 芯片 Mac(M 系列),macOS 11 Big Sur 及以上。Intel 机器装不了 |
| Windows | 64 位 Windows 10 / 11 |
| 文件 | 大小 | md5 |
|---|---|---|
| macOS | ||
智能字幕工具.dmg | 114.8 MB | 7f7f2ef3b8c93df6fbc702ccf8a7f9ba |
Subtitler-Engine-Mac.zip | 1.4 GB | 3c755865cdd125741ed493ccbc8a9b07 |
| Windows | ||
智能字幕工具-安装.exe | 123.1 MB | bbe17249a49be38de6055e27b0d2f8c8 |
Subtitler-Engine-Win.zip | 1.4 GB | 77ce4abb475ca523f2e330befc5363e2 |
微软运行库(识别报错再装).exe | 68.4 MB | cc4332bc5ad88c00d1b785598d806a53 |
一键卸载.bat | 8.1 KB | b686f18ce2d92a524cb0dd41d8197e82 |
Windows 文件夹里(微软运行库(识别报错再装).exe),平时不用下,报错时再装。对轴更准
断句更像人
样式
工程和导出
从旧版升级:Mac 下新的 dmg 拖进「应用程序」覆盖;Windows 直接运行新的安装程序。 引擎不用重下。之前在软件里存的预设因为上面那个问题没能存住,需要重新存一次。
.command、Windows 的 .bat)
全撤了,网盘里每个平台只剩两个文件:软件本体和引擎包。engine-install.log,出了问题能回头查。install-engine.ps1:
右键「使用 PowerShell 运行」就能单独补装引擎,不用重跑整个安装程序。~/Library/Subtitler,Windows 上应该是
%LOCALAPPDATA%\Subtitler,可执行文件还要带 .exe。
现在这件事统一问 bin.js,不再有第二份路径。从 0.1.0 升级:下新的 dmg 拖进「应用程序」覆盖掉旧的,引擎不用重下。
下完想核一下有没有下全:在「终端」里输 md5 加一个空格,把文件拖进窗口回车,
出来的那串和上表对得上就是完整的。网盘断点续传断在半路很常见,
而它的表现往往是「装完了但打不开」或者「识别不了」。