🆕 Новые модели 2 мин чтения

GPT-4 vs Prometheus: бенчмарк judge-моделей для RAG-оценки от LlamaIndex

Что произошло

LlamaIndex провели прямое сравнение GPT-4 и open-source модели Prometheus в роли judge для оценки RAG-пайплайнов. Prometheus показал корреляцию 0.9 с человеческими оценками и работает дешевле GPT-4 в 10 раз.

Детали

  • Prometheus (Llama-2-13B-based) показал корреляцию 0.90 с human judgments vs 0.87 у GPT-4
  • Стоимость оценки: $0.002/пример (Prometheus) vs $0.02/пример (GPT-4) — разница 10×
  • Latency: ~2 сек (Prometheus) vs ~4 сек (GPT-4) на пример
  • Метрики: relevance, faithfulness, context quality по шкале 1–5
  • Согласованность моделей: 82% совпадений при бинарной классификации
  • Фреймворк оценки: библиотека ragas

Что это значит

Для инженеров, строящих RAG-пайплайны с автоматической оценкой в CI/CD: Prometheus позволяет сократить затраты на judge в 10 раз без потери качества, при этом rubric-based подход делает оценки более прозрачными для аудита.

Prometheus (13B open-source) коррелирует с human judgments на уровне 0.90 и стоит в 10 раз дешевле GPT-4 при оценке RAG — благодаря rubric-based scoring результаты воспроизводимее, чем у проприетарных моделей.