
从折腾机翻到逐句听译,我准备把自己做的字幕分享出来想必不少兄弟都遇到过这种情况:好不容易找到一部合胃口的影片,演员、剧情、画面都喜欢,偏偏没有中文字幕。等字幕组吧,不知道要等到什么时候;自己搞机翻吧,要么找不到顺手的工具,要么折腾半天,出来的字幕还是看不下去。
我也被这个问题困扰了很久。最近前前后后折腾了不少工具,自己搭流程、试模型,最后甚至开始一句一句听译。趁这个机会,和大家聊聊我的经历,也准备把自己做的一些字幕分享出来。
机翻最让人难受的,不只是翻错,而是凭空加戏
早些时候,站里有大佬分享过 GitHub 上的字幕工具,其中的“海南鸡 v2”模型让我印象挺深。针对日译中做优化,这个方向确实很吸引我。

但在我实际测试的部分影片里,还是出现了比较影响观看的问题:正常剧情里的普通对话,有时会被翻成露骨的台词;甚至明明没有人说话,字幕里也会冒出一堆莫名其妙的内容。
后来,站里又有兄弟分享其他软件和方法,我也陆续尝试了 caption_trans、PotPlayer、Subtitle Edit 等工具,以及不同的识别和翻译方案。发现这些软件的原理都一样,都是通过使用Whisper引擎将影片的日语音频进行识别转成日语文本,再通过各种翻译模型进行中文翻译。但是经过实测,首先识别日语效果,如果正常对话没有杂音还行,但是有背景音或者女优呻吟,或者男主说话声音很低,还是识别不了。其次是翻译效果,能用的模型基本都有保护限制,没办法把做爱骚话,和鸡巴小穴这类的翻译出来。比如和large-v3模型,或者Gemini之类付费的。而且就算有些模型能够翻译,比如之前大佬github上的字幕工具那个海南鸡模型,会把整部影片,没有淫语甚至没有说话的地方,也加上了淫语字幕。和影片完全对应不上。


折腾下来,我遇到的问题主要集中在两头:前面听不清,后面翻不对。
正常剧情里,如果对白清楚、背景干净,识别效果通常还可以。但碰上背景音乐、呻吟声和说话声混在一起,或者演员声音很低、吐字含糊,就容易出现漏识别和误识别。
到了翻译环节,又是另一层问题。在我的测试里,有些模型对成人对白有限制,翻出来会回避原意;有些虽然能翻,却又容易用力过猛,把普通台词也翻得过于露骨。
我想要的其实很简单:该直白的地方直白,该正常说话的地方正常说话,没有对白的地方,就别硬加台词。字幕不是越露骨越好,而是首先得和影片对得上。
不甘心,我又自己折腾了一套流程
想着现在 AI 发展这么快,我就沿着这个思路,用 Codex 折腾了半个多月,搭了一套字幕处理流程,也围绕硬盘里的几百部影片整理了一个知识库,尝试让 AI 结合音频、画面、剧情和不同场景来处理翻译。
但实际做下来,问题并没有因此消失。尤其是成人场景里的对白,本来就经常含糊不清。有些片段,单独拿出来反复听,连人都很难分辨,更别说让 AI 一遍识别准确了。
于是,我又不断调整流程。先生成一版基础字幕,让 AI 了解整部影片的大致剧情;再让它重新听译,与前一版交叉核对。发现差异,就把对应片段重新处理,结合上下文判断,最后再统一调整中文表达。
对于识别困难的片段,我还尝试过单独截取音频、降噪、提高人声、分离不同说话人的声音,再配合画面分析,帮助理解当时的场景。
这些办法在部分片段上有帮助,但还是没能解决所有问题。
最让我警惕的是:有时候,字幕看起来已经很通顺了,却不代表它真的听对了。 一旦前面的识别出了问题,后面再怎么润色,也可能只是在把错误包装得更像那么回事。
最后,还是回到了一句一句听、一句一句改
折腾到最后,我至少在自己的这些测试里,没有找到一套能让我完全放心、不用人工复核的全自动方案。
所以,我最后选择了一个最笨、也最费时间的办法:
让 AI 完成基础字幕,再用 Subtitle Edit 自己逐句检查、调整。
遇到明显翻错、漏掉对白,或者人声太小的地方,我就单独截取那一段音频,反复听,再让 AI 针对这个片段重新识别。加上我自己半吊子的日语水平,一点一点核对。
一部影片基本就是这样一句一句听过来的。
对白核对之后,再借助 AI 调整中文语句,让表达更顺,也更贴近人物当时的语气。遇到调教、辱骂这类对白,我也会用 Grok 做一些更骚更色情的优化。这部分属于风格调整,和逐字直译不是一回事。
后来,看到站里有同一部影片的带字幕资源,我还专门拿来和自己做的版本对照过。在我对比过的部分版本里,确实能发现一些错译、漏译,以及比较明显的机翻痕迹。
当然,仅凭这些对比,也不能判断别人到底采用了什么制作方式,更不能一概而论所有字幕组。自己真正做过,才知道这件事有多耗精力。
我也不敢说自己的字幕一定比别人好,更不敢保证每一句都完全准确。只是对我而言,自己逐句核对过的版本,至少比直接拿到一份机翻结果更踏实。
没想到,做字幕本身反而成了另一种看片体验
这是整个过程里最让我意外的地方。
原来看片,更多是觉得演员不错、剧情不错、画面不错,看完也就过去了。硬盘里囤了不少,真正看得仔细、过后还能记住细节的,其实没有多少。
但做字幕不一样。为了听清一句话,你会反复看同一个片段;为了判断语气,你会留意人物前后的表情、动作和反应;为了让对白接得上,你还得重新理解整段剧情。
慢慢地,我发现自己注意到了很多以前直接略过去的东西:人物从一开始的试探、欲拒还迎,到后面逐渐投入的情绪变化;演员在不同场景里的语气和状态;还有一些原本没留意过的剧情呼应和镜头安排。
以前更多是在看画面,现在则像是在一点一点读懂这部影片。说实话,这种投入感,有时候比直接看片还强。不是因为内容变了,而是因为自己终于没有再跳着看、随便看,而是真的把注意力放进去了。
对我来说,认真做完一部影片的字幕,往往至少要花上一整天。但做完之后,对这部影片留下的印象,也远比以前随手看过深得多。(而且做字幕一做一整天,下面也会硬上一整天。我都得喝着菊花下着火做的)
后面准备把字幕分享出来,也请大家指个路
既然已经花了这些时间,我也想把自己一句一句听译、校对过的字幕陆续分享出来。
先说明一下:我不是专业翻译,日语水平也有限。字幕里难免还会有理解不到位或者处理不够准确的地方,也欢迎懂日语的朋友指正。有具体问题的话,最好带上对应时间点,方便核对和修改。
不过,目前我好像没找到直接上传 SRT 文件的方式,想请教一下熟悉站内规则的大佬:
这种自己制作的字幕,一般怎么分享到站里比较合适?有没有需要注意的发帖格式或版规?
麻烦大家指个路。后面我会把整理好的字幕陆续发出来,也算把这段时间的折腾,变成一点能和大家分享的成果。
预告——明天我会先分享这部:
MIDA-634 把看不起老子的Z世代臭新卒OL彻底调教,操成随时发情、完全听话的抖M肉便器(这部影片我花了整整3天翻译完的,因为这部影片有大量的调教羞辱对话,我用Grok加上我些许的发挥,把字幕做的更淫贱更色情)

还没有评论,来抢沙发吧。