豆包【实时通话】模型返回对话电音问题【已解决】

摘要：本文解决了豆包实时通话模型集成前端后出现电音问题。原因为火山引擎RealtimeAPI默认返回OGG封装的Opus音频，而前端期望接收PCM格式。通过在会话配置中添加tts模块，显式指定音频格式为16kHz单声道s16le PCM，使服务端返回正确格式的音频数据，解决了电音问题。关键修改是在buildSessionStartPayload()方法中加入tts配置块，包含speaker和音频参

小洪学技术

369人浏览 · 2026-03-26 15:43:45

小洪学技术 · 2026-03-26 15:43:45 发布

豆包【实时通话】模型返回对话电音问题【已解决】

- 问题总结

本次使用火山引擎的豆包端到端实时语音大模型
模型如下：
在这里插入图片描述

问题描述：我们使用后端测试大模型时语音交正常返回声音，集成到前端用户使用对话框发送文字流返回声音为电音【滋滋声】
原因：因为火山引擎 RealtimeAPI 默认返回 OGG 封装的 Opus 压缩音频，音频流和文本流是两种配置方式，这里使用的是默认格式接收时转码错误。修改文本tts配置块。

初始配置：

    private String buildSessionStartPayload() {
        return "{"
                + "\"version\":\"1.0\","
                + "\"event\":\"session_start\","
                + "\"session_config\":{"
                + "\"audio_format\":\"pcm_s16le\","
                + "\"sample_rate\":16000,"
                + "\"channel\":1,"
                + "\"language\":\"zh-CN\""
                + "},"
                + "\"vad_config\":{"
                + "\"vad_threshold\":0.5,"
                + "\"eos_silence_timeout\":1800"
                + "}"
                + "}";
    }

完善后：

  private String buildSessionStartPayload() {
        return "{"
                + "\"version\":\"1.0\","
                + "\"event\":\"session_start\","
                + "\"session_config\":{"
                + "\"audio_format\":\"pcm_s16le\","
                + "\"sample_rate\":16000,"
                + "\"channel\":1,"
                + "\"language\":\"zh-CN\""
                + "},"
                + "\"vad_config\":{"
                + "\"vad_threshold\":0.5,"
                + "\"eos_silence_timeout\":1800"
                + "},"
                + "\"tts\":{"
                + "\"speaker\":\"zh_female_vv_jupiter_bigtts\","
                + "\"audio_config\":{"
                + "\"channel\":1,"
                + "\"format\":\"pcm_s16le\","
                + "\"sample_rate\":16000"
                + "}"
                + "}"
                + "}";
    }

对比原来添加的配置：

““tts”:{”
+ ““speaker”:“zh_female_vv_jupiter_bigtts”,”
+ ““audio_config”:{”
+ ““channel”:1,”
+ ““format”:“pcm_s16le”,”
+ ““sample_rate”:16000”
+ “}”

问题总结

症状

在文本输入模式下，前端接收到的声音是刺耳的“电流声”，而音频流模式（按住说话）则正常。

根本原因

文本模式下，火山引擎 RealtimeAPI 默认返回 OGG 封装的 Opus 压缩音频，而你的后端代码（NetClient.playAudioData）和前端播放器均期望接收 16kHz、单声道、s16le 小端 PCM 格式的音频。由于格式不匹配，后端将 Opus 数据当作 PCM 解析（长度校验失败），导致播放时产生噪声。

关键发现

你最初在 DoubaoCallService 中使用的 buildSessionStartPayload() 方法没有包含 tts 配置，因此服务端未按照要求返回 PCM 音频。尽管 CallManager 等其他地方也发送了会话开始请求，但实际生效的是 DoubaoCallService 中的这个 payload（因为它控制了前端与火山引擎的握手流程）。

解决方案

在 buildSessionStartPayload() 中添加 tts 配置块，显式要求服务端返回 PCM 音频：

private String buildSessionStartPayload() {
    return "{"
            + "\"version\":\"1.0\","
            + "\"event\":\"session_start\","
            + "\"session_config\":{"
            + "\"audio_format\":\"pcm_s16le\","
            + "\"sample_rate\":16000,"
            + "\"channel\":1,"
            + "\"language\":\"zh-CN\""
            + "},"
            + "\"vad_config\":{"
            + "\"vad_threshold\":0.5,"
            + "\"eos_silence_timeout\":1800"
            + "},"
            + "\"tts\":{"
            + "\"speaker\":\"zh_female_vv_jupiter_bigtts\","
            + "\"audio_config\":{"
            + "\"channel\":1,"
            + "\"format\":\"pcm_s16le\","
            + "\"sample_rate\":16000"
            + "}"
            + "}"
            + "}";
}