🎯 Проекты 1 мин чтения

LangGraph Server автоматически поднимает REST API для локальной LLM на 16 ГБ VRAM

Selectel опубликовал вторую часть гайда по запуску облачной LLM на 16 ГБ VRAM. В этот раз — построение графовой инфраструктуры LangGraph с автоматическим созданием REST API, трейсингом в LangSmith и SDK для разработки.

Что

Практическое руководство по интеграции локальной LLM (на 16 ГБ VRAM) в продуктивную среду с использованием стека LangGraph Server, LangSmith и LangGraph SDK. Код и конфигурации приводятся для OpenAI-совместимого протокола.

Как

Архитектура строится вокруг графа состояний (state graph) в LangGraph. Ключевая идея: вы описываете логику агента в виде графа с узлами и переходами, а LangGraph Server автоматически генерирует для него REST API-эндпоинты. Это избавляет от необходимости писать обвязку (FastAPI/Flask) вручную.

Для локальной модели используется прокси-адаптер, который транслирует запросы в формат, понятный локальному инференс-серверу (например, vLLM или Ollama). LangSmith обеспечивает трейсинг каждого вызова графа: видны промпты, ответы, токены и задержки.

Цифры

  • VRAM: 16 ГБ (ограничение, определяющее выбор модели — например, 7B-модели в квантизации).
  • Автоматический API: LangGraph Server поднимает REST API для каждого скомпилированного графа без дополнительного кода.
  • Трейсинг: LangSmith фиксирует полный вызов графа, включая промежуточные шаги, использование токенов и latency.

Что перенять

Паттерн «граф состояний как единица логики + автоматический API» позволяет быстро превратить прототип агента в микросервис. Если ваша логика укладывается в DAG (например, классификация → извлечение → генерация), LangGraph избавит от написания boilerplate-кода для API и мониторинга.

LangGraph компилирует логику агента в граф состояний и автоматически поднимает для него REST API — это убирает boilerplate-код обвязки и даёт встроенный трейсинг вызовов.