1. Как запустить интерактивный режим
Используйте флаг --interactive. Параметр --text теперь необязателен:
bash
python -m omnivoice.cli.infer \
--model k2-fsa/OmniVoice \
--device mps \
--interactive \
--instruct "male, russian accent, low pitch"
Модель загрузится, прогреется (Warmup), и вы увидите приглашение Enter text to synthesize >.
Файлы будут сохраняться как output_0.wav, output_1.wav и т.д. в текущей папке.
2. Как еще больше увеличить скорость (RTF)
Если текущий RTF (0.91) кажется медленным, попробуйте следующее:
Уменьшите количество шагов диффузии (--num_step): По умолчанию стоит 8. Попробуйте 4 или даже 2. Это даст огромный прирост скорости:
bash
# Добавьте в команду запуска:
--num_step 4
Float16 на MPS: Вы уже переключили dtype на float16 в коде. С моими предыдущими исправлениями (где я вынес «глючные» для MPS операции на CPU) это должно работать корректно и значительно быстрее. Если в звуке нет шума — оставляйте float16.
Исключите холодный старт: Именно интерактивный режим, который мы только что добавили, уберет задержку в 5–10 секунд на каждой фразе, так как веса уже будут в памяти GPU.
Попробуйте запустить интерактив с num_step 4 и проверьте новый RTF!_ Ответить
Используйте флаг --interactive. Параметр --text теперь необязателен:
bash
python -m omnivoice.cli.infer \
--model k2-fsa/OmniVoice \
--device mps \
--interactive \
--instruct "male, russian accent, low pitch"
Модель загрузится, прогреется (Warmup), и вы увидите приглашение Enter text to synthesize >.
Файлы будут сохраняться как output_0.wav, output_1.wav и т.д. в текущей папке.
2. Как еще больше увеличить скорость (RTF)
Если текущий RTF (0.91) кажется медленным, попробуйте следующее:
Уменьшите количество шагов диффузии (--num_step): По умолчанию стоит 8. Попробуйте 4 или даже 2. Это даст огромный прирост скорости:
bash
# Добавьте в команду запуска:
--num_step 4
Float16 на MPS: Вы уже переключили dtype на float16 в коде. С моими предыдущими исправлениями (где я вынес «глючные» для MPS операции на CPU) это должно работать корректно и значительно быстрее. Если в звуке нет шума — оставляйте float16.
Исключите холодный старт: Именно интерактивный режим, который мы только что добавили, уберет задержку в 5–10 секунд на каждой фразе, так как веса уже будут в памяти GPU.
Попробуйте запустить интерактив с num_step 4 и проверьте новый RTF!_