Parakeet ça vous parle ?
C'est le modèle que je recommande pour Light-Whisper.
Fermion Research vient de sortir Phonon-2, une version compressée de parakeet-tdt-0.6b-v3 de NVIDIA, et le chiffre qui m'a fait tiquer c'est la taille : 164 Mo à télécharger, contre 2 508 Mo pour le modèle d'origine.
Soit 15 fois moins.
Pour y arriver, ils ont fait du quantization-aware training : chaque poids de l'encodeur ne prend qu'une valeur parmi 5 niveaux appris, environ 2,1 bits par poids.
Et selon Fermion, la précision suit : 5,21 % de WER moyen sur les sept jeux anglais de l'Open ASR Leaderboard, contre 4,96 % pour Parakeet (chiffres mesurés par Fermion, pas encore par le leaderboard lui-même).
Mais c'est la vitesse qui rend le truc vraiment intéressant :
- 174x temps réel sur un MacBook Air M5 (une heure d'audio en une vingtaine de secondes)
- 143x sur huit cœurs Zen 5, donc sans GPU
- 6 680x sur une H100 en batch de 128
Le 143x sur CPU, ça c'est dingue !
Transcrire une heure d'audio en moins de 30 secondes sur un serveur sans carte graphique, ça change l'équation pour pas mal de projets : pas de GPU à louer, pas d'API à payer à la minute.
Un pip install fermion-research suffit, et des images Docker CPU et CUDA sont fournies.
Je ne l'ai pas encore testé, donc je ne vais pas vous dire qu'il remplace Parakeet.
Je vais faire la comparaison moi-même prochainement, avec la vitesse et la mémoire mesurées sur ma machine. Et un point que je vais surveiller de près : Phonon-2 est annoncé anglais uniquement, là où Parakeet v3 gère 25 langues dont le français.