Chargement…

Test de bonsai 27b

Test de bonsai 27b

I-N-C-R-O-Y-A-B-L-E !

Dernièrement je vous parlais de Bonsai 27B, la compression du modèle Qwen 3.6 27B en ternaire qui permet au modèle de tenir sur peu de VRAM.

Dans cet article je vais vous expliquer comment le lancer en local et coder avec.

J'ai utilisé LM Studio pour télécharger le modèle:

prism-ml/Ternary-Bonsai-27B-gguf

J'ai choisi la version Q2.

Une fois téléchargé, impossible de le lancer sur mon LM Studio, car il lock la version de CUDA, mais qu'à cela ne tienne, je vais lancer le model avec un llama.cpp.

Je fais d'abord quelques tests de perf avec ma RTX 5060 Ti 16GB via llama-cli:

bonsai-27b-bench.png

Le débit en token/sec est plutôt bon, je dépasse toujours les 40 t/s.

Puis, je décide de le passer en mode serveur.

J'ai dû limiter le context à 64k, je ne pouvais pas monter à 131k étant donné que cela dépasse la capacité VRAM de mon GPU.

./build/bin/llama-server   -m ~/.lmstudio/models/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf   --alias bonsai   --host 0.0.0.0 --port 8080   -ngl 99 -c 64356 --jinja

Ensuite j'utilise le harness de Claude:

ANTHROPIC_BASE_URL=http://localhost:8080 ANTHROPIC_AUTH_TOKEN='lmstudio' CLAUDE_CODE_ATTRIBUTION_HEADER=0 claude --bare --exclude-dynamic-system-prompt-sections

Je lui demande de me faire un Pong en HTML/JS, je voulais un projet simple. Et Bonsai a plié le code en 1 minute 57:

bonsai-27b-claude-done.png

Voici le résultat:

Ce qui m'impressionne particulièrement, c'est que je n'avais rien demandé de spécial, juste de faire un pong en HTML JS et il a ajouté les effets etc de lui même.

Je suis bluffé, car cette approche permettra dans le futur de faire tourner en local des modèles bien plus ambitieux, à condition de faire quelques concessions bien entendu.

FAQ

Pourquoi le modèle ne se lance pas directement dans LM Studio ?

Parce que LM Studio verrouille sa propre version de CUDA, ce qui empêche Bonsai 27B de démarrer correctement dessus. La solution consiste à contourner LM Studio et à lancer le modèle via un serveur llama.cpp.

Quelle configuration matérielle est nécessaire pour faire tourner Bonsai 27B en local ?

Les tests ont été réalisés avec une RTX 5060 Ti 16GB, en utilisant la version quantifiée Q2 du modèle. C'est cette quantification qui permet de faire tenir un modèle de 27B de paramètres sur une carte grand public.

Comment connecter Claude Code à un modèle local comme Bonsai ?

Il suffit d'utiliser le harness de Claude en pointant les variables d'environnement ANTHROPIC_BASE_URL et ANTHROPIC_AUTH_TOKEN vers le serveur llama.cpp lancé en local. Cela permet d'utiliser l'interface Claude Code tout en interrogeant le modèle Bonsai plutôt que l'API Anthropic.

Pourquoi utiliser llama-server plutôt que LM Studio directement ?

llama-server offre un contrôle plus fin sur les paramètres de lancement, comme le nombre de couches déchargées sur le GPU ou la taille du contexte, et évite les restrictions CUDA de LM Studio. C'est l'approche utilisée ici pour exposer le modèle sur un port local accessible par le harness Claude.

Quels résultats concrets obtient-on avec Bonsai 27B sur une tâche de code ?

Sur une demande de création d'un jeu Pong en HTML/JS, le modèle a généré le code fonctionnel en environ 1 minute 27. C'est un bon indicateur de la viabilité de ce modèle compressé pour des tâches de développement simples en local.

Le paramètre -c 64356 dans la commande a-t-il une importance particulière ?

Ce paramètre définit la taille du contexte disponible pour le modèle, ce qui conditionne la quantité de code et d'échanges qu'il peut prendre en compte simultanément. Une valeur élevée est utile pour des sessions de codage avec Claude Code où plusieurs fichiers ou échanges s'accumulent.


Poursuivre la lecture

Deepseek v4 CSA et HCA Dev
#deepseek#deepseek v4#CSA

Deepseek v4 CSA et HCA

Je vous explique en détail ce qu'est le CSA et HCA de Deepseek et pourquoi c'est une révolution.

Alexandre P.
Kimi K3, nouveau model frontier open weight News
#ai#kimi k3#code agentique

Kimi K3, nouveau model frontier open weight

Kimi K3 promet 2,8 trillions de paramètres et l'étiquette "open source", mais entre l'annonce et le vrai fichier téléchargeable, l'écart mérite d'être décortiqué.

Alexandre P.