Perplexity open-sourced Unigram tokenizer: CPU-нагрузка снижена в 5–6 раз
Что произошло
Perplexity опубликовали в open source свой Unigram tokenizer, который снижает нагрузку на CPU в 5–6 раз. Решение адресует узкое место в пайплайнах reranker- и embedding-моделей, где токенизация на CPU становится заметной частью общей задержки.
Детали
- Perplexity open-sourced Unigram tokenizer на GitHub
- Снижение CPU utilization в 5–6 раз
- Адресует bottleneck в пайплайнах с быстрыми GPU-моделями
- Ключевая аудитория: reranker- и embedding-пайплайны
Что это значит
Оптимизация токенизации — low-hanging fruit для команд, у которых GPU-инференс уже быстрый, но общая латентность пайплайна выше ожидаемого.
Если embedder/reranker работает на GPU за единицы мс, а пайплайн всё равно тормозит — проверьте токенизацию на CPU: оптимизированная реализация может снизить её нагрузку в 5–6 раз.