MoE-вариант Qwen3-VL 30B-A3B ускоряет инференс в 8 раз на DGX Spark
Что произошло
На DGX Spark переход с dense Qwen3-VL-32B на MoE-вариант 30B-A3B дал 8-кратное ускорение: время обработки фото сократилось с 184 до 22 секунд, throughput вырос с 3.7 до 30 ток/с. Точность оценки содержания сохранилась, рамки чуть просели.
Детали
- Dense 32B → MoE 30B-A3B: ×8 ускорение (184с → 22с на фото)
- Throughput: 3.7 → 30 ток/с на DGX Spark (273 ГБ/с)
- Загрузка модели: 500с → 250с
- Потенциал: 20K → 100K+ фото/месяц на том же железе
- Квантизация на DGX Spark не работает: блоки для сжатых форматов не подключены в библиотеках
Что это значит
MoE-варианты VL-моделей позволяют масштабировать CV-пайплайны на существующем железе без апгрейда GPU.
MoE с ~10% активных параметров даёт ×8 ускорение на memory-bound железе (273 ГБ/с) без архитектурных изменений — просто замена модели.