LlamaParse ускорил RAG‑pipeline на 80 % за счёт оптимального размера чанков
Что произошло
В блоге LlamaIndex представлена методика подбора размера чанков для LlamaParse: при размере 512 токенов throughput вырос в 1,8 раз, а latency упала на 30 %. Исследование основано на публичных бенчмарках RAG‑pipeline.
Детали
- Оптимальный размер чанка ≈ 512 токенов
- Throughput ↑ 80 % (1 800 doc/s vs 1 000 doc/s)
- Latency ↓ 30 % (84 мс vs 120 мс)
- Снижение стоимости обработки ≈ 20 %
Что это значит
Эти цифры позволяют сразу уменьшить расходы и ускорить ответы в продуктивных RAG‑сервисах.
Подбирайте размер чанков около 500 токенов — это даёт максимум throughput и минимум latency в типичных RAG‑pipeline.