Loading...
多模态 RAG(MMRAG)
能够处理并整合文本、图像、音频、视频和结构化数据源的检索增强生成
In 30 seconds
- What
- 借助对齐的嵌入检索并融合文本、图像、音频、视频和结构化数据,把生成结果锚定在多模态证据上。
- When to use
- 需要以多种媒介为依据来作答的问题,比如结合影像与文本的医学诊断,或结合文档与截图的设计评审。
- Watch out
- 跨模态的嵌入对齐很脆弱:空间一旦错位,检索就会偏向某一种模态,让真正需要融合的回答质量下降。
Loading technique guide…