🆕 Новые модели 1 мин чтения

NVIDIA Research представила RAG‑систему с 1 Мток контекстом

Что произошло

NVIDIA Research опубликовала исследование, в котором предложена архитектура Retrieval‑Augmented Generation для LLM с контекстным окном в 1 млн токенов. На бенчмарке MMLU система превзошла базовый LLM на 12 % при почти том же уровне пропускной способности.

Детали

  • Контекстный размер до 1 млн токенов
  • Throughput 150 токенов/сек при полном контексте
  • MMLU accuracy 71,2 % vs 59,1 % у базовой модели
  • Стоимость инференса ↑ 8 % при 8‑к‑токеновом базовом контексте
  • Dense‑sparse индекс ускоряет retrieval в 5×

Что это значит

Для инженеров, разрабатывающих RAG‑системы, это демонстрирует, как масштабировать контекст без пропорционального роста затрат.

Гибридный dense‑sparse индекс + перекрывающиеся окна позволяют LLM с 1 Мток контекстом сохранять почти ту же throughput, повышая точность на 12 % в MMLU.