🆕 Новые модели 1 мин чтения

MoE-вариант Qwen3-VL 30B-A3B ускоряет инференс в 8 раз на DGX Spark

Что произошло

На DGX Spark переход с dense Qwen3-VL-32B на MoE-вариант 30B-A3B дал 8-кратное ускорение: время обработки фото сократилось с 184 до 22 секунд, throughput вырос с 3.7 до 30 ток/с. Точность оценки содержания сохранилась, рамки чуть просели.

Детали

  • Dense 32B → MoE 30B-A3B: ×8 ускорение (184с → 22с на фото)
  • Throughput: 3.7 → 30 ток/с на DGX Spark (273 ГБ/с)
  • Загрузка модели: 500с → 250с
  • Потенциал: 20K → 100K+ фото/месяц на том же железе
  • Квантизация на DGX Spark не работает: блоки для сжатых форматов не подключены в библиотеках

Что это значит

MoE-варианты VL-моделей позволяют масштабировать CV-пайплайны на существующем железе без апгрейда GPU.

MoE с ~10% активных параметров даёт ×8 ускорение на memory-bound железе (273 ГБ/с) без архитектурных изменений — просто замена модели.