Dans l'actualité
Intelligent transcription with Gemini 3.5 Transcribe
Google DeepMind · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Google a lancé Gemini 3.5 Transcribe, un modèle de reconnaissance vocale traitant l'audio en temps réel et pré-enregistré avec des taux d'erreur de 4,0% et 2,6%.
- Pourquoi ça compte
- Les développeurs construisant des agents vocaux, des sous-titres en direct ou l'analyse d'appels peuvent l'évaluer via l'API Gemini ou la plateforme Gemini Enterprise Agent.
- Vigilance
- Le support multi-locuteurs limité à trois locuteurs en phase expérimentale. Le vocabulaire personnalisé et le changement de langue nécessitent des tests en production.
Écouter ce résumé
- speech
- transcription
- gemini
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.