Skip to content

收录非语言原音回填与 audio_mode 契约 - #121

Merged
liuzhao1225 merged 1 commit into
mainfrom
codex/original-audio-mode-contract
Aug 26, 2026
Merged

收录非语言原音回填与 audio_mode 契约#121
liuzhao1225 merged 1 commit into
mainfrom
codex/original-audio-mode-contract

Conversation

@liuzhao1225

Copy link
Copy Markdown
Owner

背景

本 PR 基于当前 main 重新实现原始音频回填链路,只摘取 PR #112 中与音频时间线、翻译提示词、TranslationItem/audio_mode、原音片段、安全写入和字幕契约相关的内容。

感谢 @lyk-bit#112 中提供初始实现和思路

参考的原始提交:

改动

  • 翻译响应强制声明 ttsoriginaltts 必须有非空译文,非法或缺失模式触发重试并最终显式失败。
  • 纯语气词使用空字幕与原音,笑声、哭声、喘息等非语言声音使用自然声音字幕与原音;同时含语言和声音的片段翻译语言并使用 TTS。
  • 新产物写入 audio_mode,旧产物继续按 dst/zh 内容推断,上传字幕显式标记为 tts
  • 从完整人声音轨按原始时间范围读取原音片段,通过私有独占文件接口写入,拒绝符号链接目标并设置私有权限。
  • 原音片段不参与 TTS 全局变速因子;前序 TTS 导致片段延迟时,仍保留完整原音片段并更新实际字幕时间线。
  • TTS 回退参考排除纯非语言片段,避免使用笑声等声音建立语音提示缓存。
  • 原音模式保留声音字幕并进入 SRT。

回归验证

  • 后端定向测试:75 项通过。
  • 后端全量测试:342 项通过。
  • Node.js 22.23.2:前端 9 项测试通过。
  • ESLint、TypeScript、Next.js 16.3.3 生产构建通过。
  • 生产依赖审计:0 个漏洞。

范围说明

本 PR 未引入 gpu_memory、模型显存释放、Demucs 分块、日译中、Windows 打包等 #112 中的其他改动。

- 强制新翻译产物显式声明 tts 或 original,并兼容旧产物
- 为语气词和非语言声音回填原音,修正延迟片段时间线
- 使用私有安全写入并补齐音频、字幕、权限与管线回归测试

Co-authored-by: lyk-bit <lyk-bit@users.noreply.github.com>
@liuzhao1225
liuzhao1225 merged commit 03b00bb into main Aug 26, 2026
2 checks passed
liuzhao1225 added a commit that referenced this pull request Aug 26, 2026
@liuzhao1225
liuzhao1225 deleted the codex/original-audio-mode-contract branch August 26, 2026 09:02
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant