I-N-C-R-O-Y-A-B-L-E !
Dernièrement je vous parlais de Bonsai 27B, la compression du modèle Qwen 3.6 27B en ternaire qui permet au modèle de tenir sur peu de VRAM.
Dans cet article je vais vous expliquer comment le lancer en local et coder avec.
J'ai utilisé LM Studio pour télécharger le modèle:
prism-ml/Ternary-Bonsai-27B-gguf
J'ai choisi la version Q2.
Une fois téléchargé, impossible de le lancer sur mon LM Studio, car il lock la version de CUDA, mais qu'à cela ne tienne, je vais lancer le model avec un llama.cpp.
Je fais d'abord quelques tests de perf avec ma RTX 5060 Ti 16GB via llama-cli:

Le débit en token/sec est plutôt bon, je dépasse toujours les 40 t/s.
Puis, je décide de le passer en mode serveur.
J'ai dû limiter le context à 64k, je ne pouvais pas monter à 131k étant donné que cela dépasse la capacité VRAM de mon GPU.
./build/bin/llama-server -m ~/.lmstudio/models/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf --alias bonsai --host 0.0.0.0 --port 8080 -ngl 99 -c 64356 --jinja
Ensuite j'utilise le harness de Claude:
ANTHROPIC_BASE_URL=http://localhost:8080 ANTHROPIC_AUTH_TOKEN='lmstudio' CLAUDE_CODE_ATTRIBUTION_HEADER=0 claude --bare --exclude-dynamic-system-prompt-sections
Je lui demande de me faire un Pong en HTML/JS, je voulais un projet simple. Et Bonsai a plié le code en 1 minute 57:

Voici le résultat:
Ce qui m'impressionne particulièrement, c'est que je n'avais rien demandé de spécial, juste de faire un pong en HTML JS et il a ajouté les effets etc de lui même.
Je suis bluffé, car cette approche permettra dans le futur de faire tourner en local des modèles bien plus ambitieux, à condition de faire quelques concessions bien entendu.