LlamaIndex: методология оценки мультимодального RAG с метриками retrieval и generation
Простым языком
Мультимодальный RAG — это система, которая ищет ответы не только в тексте, но и в изображениях, таблицах и других форматах. Авторы показали, как правильно оценивать такие системы: сначала проверить качество поиска (нашёл ли нужные документы), потом — качество генерации (правильно ли модель ответила). Смешивать эти метрики нельзя, иначе не поймёшь, где именно ошибка.
Что нового
- Двухуровневая архитектура оценки: retrieval-метрики (precision@k, recall@k, MRR, nDCG) отделены от generation-метрик (LLM-as-judge с rubric-based scoring)
- Специализированные метрики для мультимодальных чанков: отдельная оценка качества парсинга таблиц и интерпретации изображений
- Пороговые значения для практических сценариев: precision@5 ≥ 0.7 для retrieval, faithfulness ≥ 0.8 для generation
- Использование ground truth эталонов с автоматической оценкой релевантности, полноты и faithfulness
- Выявление проблемы: retrieval precision для таблиц падает на 15-20% по сравнению с текстом — необходимы специализированные парсеры
Вердикт
Методология применима для production-оценки мультимодальных RAG-систем. Рекомендуется начинать с разделения retrieval и generation этапов, использовать стандартные IR-метрики для поиска и LLM-as-judge для генерации. Ограничение: для таблиц и изображений требуется дополнительная работа по парсингу, иначе retrieval-метрики будут занижены.
Оценку мультимодального RAG нужно разделять на два этапа: retrieval (precision@k, nDCG) и generation (LLM-as-judge с rubric) — смешивание метрик не даёт локализовать проблему в пайплайне.