Dans l'actualité
JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- JustFit exécute un LLM de 27 milliards de paramètres avec contexte 200K sur MacBook 24GB via compression KV et gestion d'état juste-à-temps.
- Pourquoi ça compte
- Pertinent pour les ingénieurs construisant des outils IA locaux nécessitant du raisonnement en contexte étendu sur laptops grand public sans infrastructure cloud.
- Vigilance
- Résultats démontrés sur matériel et modèle spécifiques; la généralisation à d'autres appareils, méthodes de quantization ou architectures reste incertaine.
- llm
- reasoning
- quantiz
- inference
- serving
Les patterns derrière cette actualité
- Context Editing & Tool-Result Clearing
- Agentic Context Engineering (Evolving Playbook)
- Context Compress Patterns
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.