fix: patch S3Tokenizer.log_mel_spectrogram for float64→float32 cast

The actual dtype mismatch was in S3Tokenizer.log_mel_spectrogram, not
VoiceEncoder.forward. librosa.load returns float64 numpy, which
torch.from_numpy preserves as double. The STFT output (double) then
hits _mel_filters (float32) in a matmul at s3tokenizer.py:163.

Now patching both entry points after model load:
1. S3Tokenizer.log_mel_spectrogram — cast audio to float32 before STFT
2. VoiceEncoder.forward — cast mels to float32 before LSTM

Remove debug traceback logging (no longer needed).
This commit is contained in:
James Pine
2026-03-13 05:04:29 -07:00
parent cac80f6af0
commit bfd7b815a5
2 changed files with 50 additions and 20 deletions
+22 -10
View File
@@ -178,20 +178,32 @@ class ChatterboxTTSBackend:
progress_manager.mark_complete(model_name)
task_manager.complete_download(model_name)
# Monkey-patch VoiceEncoder.forward to cast input to float32.
# The upstream melspectrogram returns float64 numpy arrays when
# hp.normalized_mels is False (the default). pack() preserves
# the dtype, so double tensors hit float32 LSTM weights
# "expected m1 and m2 to have the same dtype: float != double".
_ve = self.model.ve
_orig_ve_forward = _ve.forward.__func__ if hasattr(_ve.forward, '__func__') else _ve.forward
# Patch float64 → float32 dtype mismatches in upstream chatterbox.
# librosa.load returns float64 numpy; multiple upstream code paths
# convert it to a torch tensor via torch.from_numpy() without
# casting, then matmul it against float32 model weights.
import types
def _f32_forward(self_ve, mels):
# Patch S3Tokenizer (used by s3gen.tokenizer)
_tokzr = self.model.s3gen.tokenizer
_orig_log_mel = _tokzr.log_mel_spectrogram.__func__
def _f32_log_mel(self_tokzr, audio, padding=0):
import torch as _torch
if _torch.is_tensor(audio):
audio = audio.float()
return _orig_log_mel(self_tokzr, audio, padding)
_tokzr.log_mel_spectrogram = types.MethodType(_f32_log_mel, _tokzr)
# Patch VoiceEncoder
_ve = self.model.ve
_orig_ve_forward = _ve.forward.__func__
def _f32_ve_forward(self_ve, mels):
return _orig_ve_forward(self_ve, mels.float())
_ve.forward = types.MethodType(_f32_forward, _ve)
_ve.forward = types.MethodType(_f32_ve_forward, _ve)
logger.info("Chatterbox Multilingual TTS loaded successfully")
+28 -10
View File
@@ -178,20 +178,38 @@ class ChatterboxTurboTTSBackend:
progress_manager.mark_complete(model_name)
task_manager.complete_download(model_name)
# Monkey-patch VoiceEncoder.forward to cast input to float32.
# The upstream melspectrogram returns float64 numpy arrays when
# hp.normalized_mels is False (the default). pack() preserves
# the dtype, so double tensors hit float32 LSTM weights
# "expected m1 and m2 to have the same dtype: float != double".
_ve = self.model.ve
_orig_ve_forward = _ve.forward.__func__ if hasattr(_ve.forward, '__func__') else _ve.forward
# Patch float64 → float32 dtype mismatches in upstream chatterbox.
# librosa.load returns float64 numpy; multiple upstream code paths
# convert it to a torch tensor via torch.from_numpy() without
# casting, then matmul it against float32 model weights.
# We patch the two known entry points:
#
# 1. S3Tokenizer.log_mel_spectrogram — the audio tensor from
# librosa hits _mel_filters (float32) in a matmul.
# 2. VoiceEncoder.forward — float64 mel spectrograms hit the
# float32 LSTM weights.
import types
def _f32_forward(self_ve, mels):
# Patch S3Tokenizer (used by s3gen.tokenizer)
_tokzr = self.model.s3gen.tokenizer
_orig_log_mel = _tokzr.log_mel_spectrogram.__func__
def _f32_log_mel(self_tokzr, audio, padding=0):
import torch as _torch
if _torch.is_tensor(audio):
audio = audio.float()
return _orig_log_mel(self_tokzr, audio, padding)
_tokzr.log_mel_spectrogram = types.MethodType(_f32_log_mel, _tokzr)
# Patch VoiceEncoder
_ve = self.model.ve
_orig_ve_forward = _ve.forward.__func__
def _f32_ve_forward(self_ve, mels):
return _orig_ve_forward(self_ve, mels.float())
_ve.forward = types.MethodType(_f32_forward, _ve)
_ve.forward = types.MethodType(_f32_ve_forward, _ve)
logger.info("Chatterbox Turbo TTS loaded successfully")