智能字幕工具

配音已经录好了,字幕自己对轴

拖进音频或视频,贴上配音稿,点一下。时间轴对好,样式随便调, 导出成透明 MOV 或者直接烧进画面。

先确认:你这台机器能不能装

macOS 只支持 Apple 芯片的 Mac(M1 / M2 / M3 / M4),macOS 11 Big Sur 及以上。
Intel 芯片的 Mac 装不了 —— 不是「功能少一点」,是根本打不开: 软件本体和识别引擎都是 Apple 芯片版,而 macOS 没有「Intel 跑 arm 程序」这回事 (Rosetta 只能反过来)。Intel 版还在做。
怎么看:点左上角 → 关于本机,「芯片」那一行写着 M 开头的就是 Apple 芯片。
Windows 64 位的 Windows 10 或 11。
Windows 版少一个导出格式(HEVC alpha 是 macOS 独有的编码器),其余功能一样。

网盘里有什么

按平台分成两个文件夹,进自己那个,前两个文件都下,另一个文件夹和你无关。 这份教程在最外层,两个平台共用。

macOS 文件夹是什么
智能字幕工具.dmg软件本体,约 113MB
Subtitler-Engine-Mac.zip语音识别引擎,1.4GB。不用解压,软件自己会处理
Windows 文件夹是什么
智能字幕工具-安装.exe软件本体,约 122MB
Subtitler-Engine-Win.zip语音识别引擎,1.4GB。不用解压,软件自己会处理
微软运行库(识别报错再装).exe微软 VC++ 运行库。平时不用下:只有识别时报「缺少运行库」才要装,大多数电脑早就有了
一键卸载.bat想卸载的时候再下它,装的时候用不着

装:两步

  1. 装软件本体

    macOS:双击 智能字幕工具.dmg,把图标拖进右边的「应用程序」。 一定要拖过去再打开 —— 留在「下载」里运行的话,系统每次都会拦,清理下载目录时还会连软件一起删掉。
    第一次打开如果提示「无法验证开发者」:在「应用程序」里右键点图标 → 打开 → 再点一次「打开」。 较新的 macOS 弹窗里可能没有「打开」按钮,那就去系统设置 → 隐私与安全性,在下面点「仍要打开」。 这一步只用做一次。

    Windows:双击 智能字幕工具-安装.exe,按向导下一步装完, 可以自己选安装位置,不需要管理员权限。
    第一次运行大概率会弹一个蓝色窗口「Windows 已保护你的电脑」: 点左边那行小字「更多信息」,再点「仍要运行」。 这是 SmartScreen 对没买代码签名证书的软件的例行拦截,和病毒无关,只有第一次要这样。

  2. 打开软件,等它自己把引擎装好

    这一步你什么都不用做。软件一打开就会在这台电脑上找那个 1.4GB 的 zip (下载、桌面、文档,各翻两层),找到了直接开装 —— 屏幕中间出来一个小窗口告诉你在干什么, 一两分钟,装完它自己关掉,软件接着开。不用解压,不用跑脚本,一次都不用点。

    只有真找不到那个包时(比如你下到别的盘去了),它才会问你一句, 按钮是「我下好了,选给它」,点一下挑中那个 zip 就行; 框里还会列出它找过哪些目录。

    装的过程要 3.4GB 左右的空闲空间(压缩包和解出来的文件同时在盘上),装完占约 1.6GB: macOS 在 ~/Library/Subtitler/,Windows 在 %LOCALAPPDATA%\Subtitler。 想卸载引擎就把这个文件夹删掉。

    装成了就没有任何多余的框,直接进软件。真没装成才会弹一个框写明原因 (多半是磁盘空间不够,或者那个 zip 没下完整 —— 它应该有 1.4GB 左右)。

引擎为什么单独发:模型 1.6GB 而且几乎不变。打进安装包的话, 每次软件更新你都要重下一遍 1.6GB。分开之后更新只有一百多兆,引擎留在本机不动。
不装也能用:手动打轴、样式、预览、导出全都不受影响, 只有「自动语音识别匹配」这一步用不了。
别用网盘网页版的「在线解压」,下到本地就行 —— 那 1.4GB 的包压根不用你动手解。

登录与试用

打开软件先要用本站(sjfls6.com)的账号登录 —— 和网站是同一套账号, 不用记激活码,也不用报机器码。两种登法:

还没试用过的账号,登录后窗口里会直接出现「申请 10 天免费试用」—— 点一下就开通,不用回网站跑一趟。试用每个账号只有一次, 从点下那一刻起算 10 天,功能不阉割。

断网能不能用:能。每次打开会联网核一次授权,核过之后 24 小时内断网照常工作。除了这一次校验,软件全程不联网 —— 音频、视频、文案都留在你自己的电脑上。
换电脑:重新登录一次就行。同时最多 2 台设备, 第 3 台登录时最早的那台自动下线,可以在账号中心里管理。

怎么用

  1. 把素材拖进来

    音频、视频都行 —— mp4、mov、mp3、wav、m4a 这些常见格式都认。 拖进来之后左边会显示时长和识别出的人声段数,下方时间轴上会出现波形。

  2. 贴上配音稿

    把念稿子的那份文字贴进「字幕脚本」框。标点会自动去掉,长句按语义断行。 如果你自己已经分好了行,保持「我敲的换行就是一条字幕」勾着,就一行一条。

  3. 点「自动语音识别匹配」

    第一次要等一会儿(识别一分钟的音频大约几秒到十几秒,看模型和机器)。 之后再调断句、改参数都是秒出,不会重新识别。

  4. 调样式

    右边面板管字体、填充、描边、投影、位置。改动实时反映在预览上, 而且预览就是导出结果 —— 用的是同一段渲染代码。

  5. 导出

    右上角「导出」。要拿进剪辑软件就选透明格式,直接发出去就选烧录。

它和别的字幕工具哪里不一样: 文字永远用你给的那一份,语音识别只负责提供时间。所以识别把「多机协同」听成「多计协同」, 也不影响成品字幕 —— 屏幕上出现的还是你写的字,只是借用了识别出来的时间点。

没有稿子:拖进来就出字幕

左边「语音识别」那栏勾上「拖进来就直接出字幕(没贴脚本时自动识别)」, 之后拖进音频就自己往下走:识别、断句、对轴一气呵成,不用点任何按钮。 脚本框里已经贴了字的时候不会自动跑 —— 那说明你走的是有稿那条路,机器不替你做主。

这条路的时间轴照样准,但文字是识别出来的,一定有错别字 (专有名词尤其容易错,「星揆」听成「星魁」这种)。所以改错字要成批地改:

  1. 点「字幕脚本」右上角的「校对」

    弹窗上半部是全文,一行一条、行首带编号。点「复制全文」拿走。

  2. 拿出去改

    丢给 AI 或者在任何编辑器里改都行。交代清楚一句话: 只改错别字,保留行首编号,不要增删行、不要合并行

  3. 贴回下面那个框,点「回填」

    它按编号逐条换文字,时间轴分毫不动,手工拆过的条也不会被重排。 编号对不上的条目会原样留着,并且明确告诉你是第几条 —— 不会把一条改到别处去。

准到什么程度

拿 20 句中文配音测的(逐句合成再按已知停顿拼接,所以每一句的真实起止时间精确到毫秒):

指标智能字幕工具按字数均分(很多工具的做法)
起点平均误差21 ms552 ms
终点平均误差78 ms805 ms
误差中位数35 ms675 ms
最差的一条180 ms1638 ms
误差在 100ms 以内的比例93%3%

人眼能察觉字幕和声音不同步的门槛大约是 100 毫秒。也就是说绝大多数情况下你看不出偏差, 最差的一条也只有零点一八秒。

界面上的几处提示

匹配度

左下角会显示一个百分比,意思是「脚本里有多少字在音频里找到了对应」。

时间轴上的黄边

这一条有需要留意的地方:字太多读不完(超过 9 字/秒)、停留时间太短(不到 0.6 秒), 或者这条没在音频里对上。点中它,下面的编辑框里可以直接改文字和时间。

渐变怎么调

把「填充」或「描边」的类型选成线性渐变,会同时出来两处控件:

① 画面上的控制器(管方向和范围)

类型一选成渐变,字幕上就直接出现一条渐变线 —— 和在 Figma 里选中图层调渐变是一回事:

角度是这么定义的 水平(左→右)、90° 垂直(上→下)、 180° 水平(右→左)、270° 垂直(下→上)。就是渐变方向和水平线的夹角,顺时针。

两端圆点能拖到文字框外面,也能收进文字里 —— 后者的意思是 「渐变只在这一小段里完成,两头都是纯色」,这是光给一个角度值做不到的。

② 面板里的滑杆(管颜色和分布)

两处改的是同一条渐变,改哪边另一边都会跟着动。描边也能用渐变 —— 综艺字幕那种「金边」就是这么做的。

时间轴怎么操作

快捷键

空格播放 / 暂停
前后移动一帧(按住 是一秒)
选上一条 / 下一条字幕
Z撤销(Windows 上是 CtrlZ

这份说明里写的 在 Windows 上一律换成 Ctrl 就是 Shift

导出格式怎么选

要拿进剪辑软件(透明背景)

ProRes 4444最通用的透明视频格式,Premiere、达芬奇、Final Cut 都认。文件比较大,一分钟 1080p 大概 200~300 MB。不确定选什么就选它。
HEVC alpha同样是透明视频,体积只有 ProRes 的零头。苹果生态里通用性好,Windows 侧的软件支持要看具体版本。仅 macOS 可导。
QuickTime RLE无损透明,兼容一些老软件。文件最大。
WebM VP9网页上能直接播的透明视频。
PNG 序列什么软件都能进,也最占地方。

直接要成品

烧录 MP4字幕压进画面,发微信、传抖音直接用。
烧录 ProRes同上但画质更高,适合还要再剪一道的场合。

纯文本字幕

SRT最通用,只有文字和时间,样式一概没有。
ASS唯一能带样式的文本格式 —— 字体、字号、颜色、描边、位置都在里面, 剪映、Premiere、播放器都认,而且导出后还能继续改。
但它表达不了渐变填充、多重描边、投影模糊,导出时会自动降级并明确告诉你降了什么。
VTT网页 <track> 用的。
LRC歌词格式,只有起点没有终点。
工程文件把字幕和样式一起存成 JSON,以后可以接着编辑。

常见问题

没有配音稿,能直接从语音生成字幕吗?

能。脚本框留空直接点「自动语音识别匹配」,它会把识别稿填进去; 勾上「拖进来就直接出字幕」连这一下都不用点。 但识别稿一定会有错字,务必自己校一遍 —— 用「校对」批量改, 见上面「没有稿子:拖进来就出字幕」那一节。 有稿子的话请一定贴稿子,结果的质量差得很远。

识别把字认错了,字幕会跟着错吗?

不会。屏幕上出现的永远是你贴进去的那份文字,识别结果只用来定位时间。 这也是为什么强烈建议贴稿子。

字幕整体早了或晚了一点

左边「对轴微调 → 整体提前」拉一下,正数是字幕比声音早出来。 默认提前 40 毫秒 —— 字幕稍微早一点点,观感上才是同步的。

一条字幕太长,读不完

把「每行最多」调小,或者「最多行数」改成两行。改完会自动重新对轴,不用再识别一次。 也可以选中那一条,把光标放在要断开的位置,点「拆分」。

想做双语字幕

右边面板切到「第二字幕」,勾上启用,就能给第二行单独设字体、字号和样式。 每条字幕下方会多出一个输入框,填第二语言的文字。

Windows 上识别报错,提示缺少 Visual C++ 运行库(或者一串数字:3221225781)

这台电脑缺微软的 VC++ 运行库,语音识别引擎要用它。先安装运行库再试: 网盘 Windows 文件夹里的 微软运行库(识别报错再装).exe,双击装上,重新打开本软件就好。 装一次就行,不用重装本软件。网盘下不了的话,也可以从微软官网下 vc_redist.x64.exe(x64 版)。 软件启动时发现缺运行库也会先弹框提醒。

Windows 上识别比 Mac 慢很多

正常。Mac(M 系列芯片)用显卡算,几分钟的配音几秒就识别完;Windows 版只用 CPU 算,会慢不少, CPU 核越多越快。在 Mac 上用虚拟机(Parallels 等)跑 Windows 版会更慢 —— 那是在模拟 x64,速度不能代表真的 Windows 电脑。

找不到某个字体

字体搜索框中英文名都能搜,繁简也通用(搜「苹方」能找到「蘋方」)。 如果确实没有,确认字体装在系统的字体目录里,然后重启一次软件重新扫描。

关掉软件再打开,之前做的还在吗?

样式和「我的预设」会自动记住。素材、稿子和字幕要留存,用顶栏的「保存工程」 存成一个 .flssub 文件,下次「打开工程」(或者直接双击它)接着改,识别结果也在里面,不用再识别一次。

Windows 上提示「Windows 已保护你的电脑」

点左边那行小字「更多信息」,再点「仍要运行」就行。 这是 SmartScreen 对没买代码签名证书的软件的例行拦截 —— 一张证书一年好几千, 还要靠下载量慢慢积累信誉,小工具通常不买。只有第一次要这样。

Windows 版和 Mac 版有什么不一样?

只差一个导出格式:HEVC alpha(体积最小的透明视频)用的是 macOS 独有的 编码器,Windows 上没有。透明视频在 Windows 上走 ProRes 4444、WebM VP9 或者 PNG 序列, 对轴精度、样式、其余所有导出格式都一模一样。

素材会上传到网上吗?

不会。所有处理都在你自己的电脑上完成。软件只在打开时联一次网核授权,除此之外不联网 —— 音频、视频、文案都不会离开这台电脑。

配音带背景音乐,能用吗?

能。软件在识别之前会先把纯音乐、长静音的段落裁掉,只把人声送去识别。 一段开场有 12 秒纯音乐的发布会配音,实测全篇匹配度 100%。

不做这一步的话,语音识别会在音乐段「幻听」,凭空吐出一整段不存在的文字, 还会连带吞掉后面十几秒真正的人声 —— 那才是「带 BGM 就对不准」的真正原因, 和音乐吵不吵关系不大。

目前还没把握的是音乐和人声重叠的段落(边放音乐边说话)。 如果手上有纯人声那一轨,用它来对轴,对好之后再回到成片上用。

怎么卸载

软件本身好卸,麻烦的是那 1.6GB 引擎 —— 它不在软件目录里,卸载软件不会带走它。

Windows

网盘 Windows 文件夹里有个 一键卸载.bat,双击它, 按提示输入 y 回车。它会依次清掉三样:1.6GB 的语音识别引擎设置和登录凭据软件本身(最后一步会拉起系统的卸载程序, 跟着点完就行)。

窗口里的提示是英文的 —— .bat 文件里只要混进一个中文字符, cmd 的解析就会错位。看到最后一行 [OK] Done. 就是清干净了。

只想卸软件、把引擎留着(比如过阵子还要装回来)?那就走系统的 设置 → 应用 → 已安装的应用,找到「智能字幕工具」卸载。 引擎会留在 %LOCALAPPDATA%\Subtitler,重装软件后直接就能用,不用重下。

macOS

三样东西,删掉就行:

/Applications/智能字幕工具.app软件本体,拖进废纸篓
~/Library/Subtitler/1.6GB 的语音识别引擎
~/Library/Application Support/subtitler-desktop/设置和登录凭据

后两个在访达里按 G,粘贴路径回车就能到。 同样,只想卸软件、留着引擎的话,只删第一个。

卸载不影响你买的授权。授权挂在 sjfls6.com 的账号上,不在这台电脑上 —— 换机器、重装系统,重新登录一次就回来了,不用记激活码,也不用报机器码。

版本与校验

版本0.2.16
发布2026-09-11
macOSApple 芯片 Mac(M 系列),macOS 11 Big Sur 及以上。Intel 机器装不了
Windows64 位 Windows 10 / 11
文件大小md5
macOS
智能字幕工具.dmg114.8 MB7f7f2ef3b8c93df6fbc702ccf8a7f9ba
Subtitler-Engine-Mac.zip1.4 GB3c755865cdd125741ed493ccbc8a9b07
Windows
智能字幕工具-安装.exe123.1 MBbbe17249a49be38de6055e27b0d2f8c8
Subtitler-Engine-Win.zip1.4 GB77ce4abb475ca523f2e330befc5363e2
微软运行库(识别报错再装).exe68.4 MBcc4332bc5ad88c00d1b785598d806a53
一键卸载.bat8.1 KBb686f18ce2d92a524cb0dd41d8197e82

0.2.16 · 2026-09-11

0.2.15 · 2026-09-11

对轴更准

断句更像人

样式

工程和导出

从旧版升级:Mac 下新的 dmg 拖进「应用程序」覆盖;Windows 直接运行新的安装程序。 引擎不用重下。之前在软件里存的预设因为上面那个问题没能存住,需要重新存一次。

0.2.7 · 2026-09-10

0.2.6 · 2026-09-10

0.2.5 · 2026-09-10

0.2.4 · 2026-09-10

0.2.3 · 2026-09-10

0.2.2 · 2026-09-10

从 0.1.0 升级:下新的 dmg 拖进「应用程序」覆盖掉旧的,引擎不用重下。

下完想核一下有没有下全:在「终端」里输 md5 加一个空格,把文件拖进窗口回车, 出来的那串和上表对得上就是完整的。网盘断点续传断在半路很常见, 而它的表现往往是「装完了但打不开」或者「识别不了」。