Chargement…

Phonon-2 : Parakeet dans 164 Mo

Phonon-2 : Parakeet dans 164 Mo

Parakeet ça vous parle ?

C'est le modèle que je recommande pour Light-Whisper.

Fermion Research vient de sortir Phonon-2, une version compressée de parakeet-tdt-0.6b-v3 de NVIDIA, et le chiffre qui m'a fait tiquer c'est la taille : 164 Mo à télécharger, contre 2 508 Mo pour le modèle d'origine.

Soit 15 fois moins.

Pour y arriver, ils ont fait du quantization-aware training : chaque poids de l'encodeur ne prend qu'une valeur parmi 5 niveaux appris, environ 2,1 bits par poids.

Et selon Fermion, la précision suit : 5,21 % de WER moyen sur les sept jeux anglais de l'Open ASR Leaderboard, contre 4,96 % pour Parakeet (chiffres mesurés par Fermion, pas encore par le leaderboard lui-même).

Mais c'est la vitesse qui rend le truc vraiment intéressant :

  • 174x temps réel sur un MacBook Air M5 (une heure d'audio en une vingtaine de secondes)
  • 143x sur huit cœurs Zen 5, donc sans GPU
  • 6 680x sur une H100 en batch de 128

Le 143x sur CPU, ça c'est dingue !

Transcrire une heure d'audio en moins de 30 secondes sur un serveur sans carte graphique, ça change l'équation pour pas mal de projets : pas de GPU à louer, pas d'API à payer à la minute.

Un pip install fermion-research suffit, et des images Docker CPU et CUDA sont fournies.

Je ne l'ai pas encore testé, donc je ne vais pas vous dire qu'il remplace Parakeet.

Je vais faire la comparaison moi-même prochainement, avec la vitesse et la mémoire mesurées sur ma machine. Et un point que je vais surveiller de près : Phonon-2 est annoncé anglais uniquement, là où Parakeet v3 gère 25 langues dont le français.

FAQ

Phonon-2 fonctionne-t-il en français ?

Non, il est annoncé anglais uniquement pour l'instant, contrairement à Parakeet v3 qui couvre 25 langues dont le français. C'est un point de vigilance si votre projet nécessite du multilingue.

Comment installer Phonon-2 ?

Un simple pip install fermion-research suffit. Des images Docker sont aussi fournies, en version CPU et CUDA, selon votre matériel disponible.

Faut-il un GPU pour l'utiliser efficacement ?

Non, c'est justement l'intérêt du modèle : sur huit cœurs Zen 5 sans GPU, il atteint 143x temps réel, soit une heure d'audio transcrite en moins de 30 secondes. Cela permet d'éviter de louer une carte graphique pour ce genre de tâche.

Les chiffres de précision annoncés sont-ils fiables ?

Les 5,21 % de WER moyen viennent des mesures de Fermion Research elles-mêmes, pas encore validées par l'Open ASR Leaderboard. Il faut donc rester prudent tant qu'une évaluation indépendante n'a pas confirmé ces résultats.

Phonon-2 peut-il remplacer Parakeet dans light-whisper ?

L'auteur n'a pas encore testé le modèle et prévoit de faire une comparaison avec sa propre mesure de vitesse et de mémoire. Pour l'instant aucune recommandation de remplacement n'est faite.

Pourquoi la taille du modèle a-t-elle autant diminué ?

Grâce à un entraînement avec quantization-aware training, chaque poids de l'encodeur est réduit à environ 2,1 bits en ne prenant qu'une valeur parmi 5 niveaux appris. Cela permet de passer de 2 508 Mo à 164 Mo tout en conservant une précision proche de l'original.


Poursuivre la lecture

Google Flow : le studio IA qui veut tuer la post-prod News
#google flow#production#generative ia

Google Flow : le studio IA qui veut tuer la post-prod

Google Flow réunit Veo 3.1, Gemini Omni et Nano Banana dans un seul studio génératif. Un tour d'horizon complet des fonctionnalités, des tarifs et de la concurrence.

Alexandre P.
Light-Whisper, le transcript open source Dev
#whisper#mac#linux

Light-Whisper, le transcript open source

Je vous présente un projet open source que je partageais dernièrement. Vibe codé avec Claude, mon cher collègue surdoué.

Alexandre P.