Dans l'actualité
5 useful things you'll learn in my new post-training textbook (shipping now!)
Interconnects · Nathan Lambert · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Nathan Lambert a publié un manuel sur le reinforcement learning from human feedback pour le post-training des grands modèles de langage, disponible chez Manning et Amazon.
- Pourquoi ça compte
- Les ingénieurs construisant ou optimisant des systèmes de post-training LLM ont besoin de comprendre les algorithmes RL, la conception système et les défaillances courantes en production.
- Vigilance
- Le livre cible des ingénieurs avec un diplôme en informatique et suppose des connaissances fondamentales; ce n'est pas une ressource d'introduction pour les débutants complets.
Écouter ce résumé
- post-train
Les patterns derrière cette actualité
- Reinforcement Learning from Human Feedback
- Reinforcement Learning from AI Feedback
- Progressive Rollout & Shadow Mode
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.