
为什么做这个工具?
剪辑师都懂:给视频加字幕是一件耗时且枯燥的事。
用 SRT 导入 FCPX?文字样式没法调,想改字体、大小、位置、颜色?抱歉,不行。一条条手动打字幕?几十条字幕输完,半天过去了。外包给语音转文字服务?音频文件要上传,隐私不保障,还要花钱。
AiFcpxSrt 就是为解决这些问题做的。
它能做什么
把音频文件拖进去,点一下,字幕就出来了。
不是简单的 SRT 文件,是原生 FCPX 字幕——导入后直接出现在时间线上,字体、大小、颜色、位置、效果,全部可以在 FCPX 里自由调整,和手动加的字幕一模一样。
支持双语模式(中文 + 英文双行字幕),英文原生 FCPX 样式。
核心流程
音频 → Whisper 语音识别 → 文案对齐校正 → LLM 翻译 → 原生 FCPXML 字幕全程本地运行,不需要上传任何文件。Apple Silicon M 芯片 GPU 加速。
开发历程(按时间)
第一阶段:核心功能
- Whisper 语音识别 + Qwen LLM 纠错 pipeline
- 原生 FCPXML 字幕导出(多行 title 元素)
- 双语模式(CN lane 1 / EN lane 2)
- 一键导入 FCPX
第二阶段:交互优化
- 双语预览/编辑(CN 可编辑,EN 灰色不可编辑状态)
- 右击「重新翻译」单条字幕
- 保存/打开会话进度(.aifcpxsession JSON 文件)
- HSplitView 布局,黑线分隔工具栏和内容区
- 深色模式
第三阶段:授权系统
- LicenseManager 单例状态机
- OnlineVerifier 服务端通信 + HMAC 验签
- 设备指纹生成(DeviceFingerprint)
- LicenseView 输入界面
- 激活成功弹窗确认
第四阶段:稳定性修复
- 指纹计算去掉 MAC 地址(解决网络接口顺序导致的指纹不稳定)
- 指纹结果缓存到默认设置(解决算法变更导致的设备身份变化)
- 启动状态同步判定(不再依赖异步 cache 校验,消除界面闪烁)
- 后台校验不降级状态(只显示错误,不踢回授权页)
第五阶段:产品化
- SVG/PNG 图标制作,替换为 Final Cut Pro 风格图标
- 正式将软件名称定为「AiFcpxSrt」
- 关于界面(开发链接、邮箱、版本信息、发行说明)
- 构建脚本自动打包(build.sh)
- ffmpeg 捆绑
第六阶段:真实进度 + LLM 翻译
- ASR 进度从假脉冲(线性 2%/2s)改为截获 mlx_whisper 内部 tqdm 的真实进度
- 中+英双语的英文通道从双次 ASR 改为 LLM 翻译(Qwen 2.5)
- 引入音频语言选择器(中文 / English),分离 ASR 语种和目标字幕语种
- "自动校正"按钮扩展为两步:校正(有文案时)→ 翻译(需翻译时)
- 翻译在校正之后执行,保证英文翻译质量
技术栈
- 语言: Swift 6.2 (SwiftUI + Combine) + Python 3
- AI 模型: Whisper medium (MLX 4bit) + Qwen 2.5 1.5B (4bit)
- 语音识别: mlx-whisper(Apple GPU 加速)
- LLM 翻译: Mlx-lm + Qwen 2.5(离线本地推理)
- 加密: CryptoKit (AES-GCM, HMAC-SHA256)
- 构建: Swift Package Manager + PyInstaller
- 最低系统: 理论上MAC M1以上系统都能运行,不限版本
- 架构: Apple Silicon (arm64)
补充说明:站长的开发环境为MacBook Pro M4 16+512 2024 Sequoia 15.7.5 在此系统上测试了全流程通过,所以环境仅供参考。由于没有更多系统版本的机器、系统可供测试,拿到软件的,请自行测试。 Intel 版的Mac 机器就不要试了,跑不起来的,架构不一样。
Final Cut Pro: 我测试了两个版本 11.2和 12.3,均导入通过。
硬件要求
- Apple Silicon Mac(M1 / M2 / M3 / M4 /M5)
- macOS 11+(编译环境系统为15.7.5)
- 建议 16GB 内存
当前状态(2026-07-11)
- 核心功能稳定,授权系统运行正常
- 双语模式:中文 ASR + LLM 翻译为英文,英文音频同理反向
- 构建系统完成:一次脚本生成两种 app(Dev / Release)
- 待做:服务端解除设备绑定 API、在线校验周期性定时器
- 持续优化:更详细的错误信息透传、用户体验打磨
一点感受
做这个工具的初衷其实很简单——我懒得一条条打字幕。又不想给剪映充钱,我就是想白嫖。
但做着做着发现,很多剪辑师都在忍受同样的事情。FCPX 文件格式晦涩难懂,SRT 与 FCPX 之间存在巨大的功能鸿沟。本地的 AI 模型越来越强,跑在 M 芯片上又快又省电,为什么不利用起来?
这么好用的工具,我收个打包费,不过份吧?
它还有一个更豪华的展示链接: AiFcpxSrt Fincal Cut Pro 字幕自动识别
下载地址:
AiFcpxSrt Fincal Cut Pro 字幕自动识别下载地址
图片展示:
这是AI根据加载的音频刚生成的初始字幕,断句准确,可能会有错别字
经过加入文案文档后,用算法重新校正后的效果,可以发现错别字已全部纠正:
这是点击一键导入Final Cut Pro后提示把字幕放到哪个事件中:
导入过度条
导入成功:
评论 (0)