Dans l'actualité
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Keyword-matching benchmarks incorrectly credit small language models for tool use they cannot actually perform, requiring stricter diagnostics.
- Pourquoi ça compte
- When evaluating tool-use capabilities of small models under 1.2 billion parameters before production deployment.
- Vigilance
- The diagnostic ladder is cheap but needs careful implementation; seed sensitivity limits generalizability across different model architectures.
- language model
- small model
- tool use
- tool-use
- tokenizer
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.