RA-DIT: двойной тюнинг LLM и ретривера для улучшения RAG
Простым языком
RA-DIT — это способ улучшить RAG-систему, обучая её два компонента одновременно. Сначала языковую модель учат использовать предоставленные документы для ответа, а затем ретривер учат искать именно те документы, которые помогают этой модели. Вместо независимой работы компоненты начинают «подстраиваться» друг под друга.
Что нового
- Двойной тюнинг: адаптируются одновременно LLM и ретривер, а не только один компонент
- Ретривер обучается на полезность для LLM, а не на семантическую близость запроса и документа
- Двухэтапный процесс: сначала retrieval-augmented instruction tuning для LLM, затем дообучение ретривера на фидбеке от адаптированной модели
- Петля обратной связи между компонентами вместо пассивного пайплайна
Вердикт
Применять в production RAG-системах, особенно в узких доменах (юриспруденция, медицина, финансы), где стандартные эмбеддинги дают много шума. Не применять, если нет размеченных данных или ресурсов на дообучение двух компонентов.
RA-DIT: дообучайте ретривер не на семантическую близость, а на полезность для конкретной LLM — это даёт +2–5% точности на open-domain задачах.