Dans l'actualité
Multi-modal RAG on slide decks
LangChain · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- LangChain a publié un tutoriel pour appliquer la RAG sur des présentations en utilisant des LLMs multi-modaux comme GPT-4V pour extraire le contenu visuel.
- Pourquoi ça compte
- Utile pour les ingénieurs construisant des assistants Q&A ou chat sur des présentations, decks investisseurs ou documents mixtes texte et images.
- Vigilance
- La précision de la récupération d'images reste le défi central. La multi-vectorisation atteint 90% mais nécessite de pré-calculer les résumés.
Écouter ce résumé
- rag
- eval
- benchmark
- gpt
Les patterns derrière cette actualité
- Generative UI (Agent-Rendered Interfaces)
- Tool Retrieval (Tool RAG)
- GAIA: General AI Assistants Benchmark
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.