На главную
Лента · AI-индустрия · ежедневно

Новости

Лента обзоров и комментариев по AI-индустрии: новые модели, корпоративные внедрения, вайбкодинг и проекты. Короткие заметки с моим взглядом.

Подписаться: RSS · JSON Feed

Июнь 2026
🆕 Новые модели 1 мин
Yandex споттер‑модель «Алиса» сжата до 200 KB и потребляет в 10 раз меньше энергии
Для локального распознавания активации «Алиса» Яндекс уменьшил модель‑споттер с 1,7 МБ до 200 KB, используя дистилляцию, глубинную разделимую свёртку и 8‑битное квантование, а также добавил VAD и чередование микрофонов, что снизило энергопотребление в 10 раз.
🎯 Проекты 1 мин
Релиз плагинов Koda 0.9.8 и CLI 0.3.6: автоотмена зависших стримов и новые команды skills
Koda выпустила обновления плагинов 0.9.8 для VSCode и JetBrains и CLI 0.3.6, включив автоотмену зависших генераций, асинхронный мост webview‑IDE и новые команды установки/удаления skills.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
NotebookLM теперь работает на Gemini 3.5 и поддерживает генерацию PDF, PPTX и таблиц
Google обновил NotebookLM: сервис переходит на модель Gemini 3.5, каждый блокнот запускается в отдельном виртуальном окружении и добавляет экспорт в PDF, DOCX, PPTX, XLSX и другие форматы.
🎯 Проекты 1 мин
⚒ Вайбкодинг 1 мин
Open‑Weights агент на mimo‑v2.5‑pro занял TOP‑20 в ECOM1 с 72 баллами
Агент, построенный на 1‑трактовой sparse MoE‑модели mimo‑v2.5‑pro (42 B активных параметров) и работающий в кодовой песочнице, занял слепое TOP‑20 в соревновании ECOM1, получив 72 балла на Ultimate Leaderboard.
🏢 Корпоративное 1 мин
🆕 Новые модели 1 мин
🎯 Проекты 1 мин
Как задать собственную цену модели Claude Fable 5 в AgentsView
В AgentsView не было цены для только что вышедшего Claude Fable 5, поэтому Simon Willison показал, как добавить пользовательскую стоимость. В результате сегодня его проект «prod_datasette_agent» уже стоит $74.06, а остальные задачи — от $0.15 до $3.98.
🆕 Новые модели 1 мин
Anthropic представила Claude Fable 5 с миллионом‑токенной памятью и новыми бенчмарк‑результатами
Anthropic выпустила Claude Fable 5 — первую модель серии Mythos, доступную без специального допуска. На ключевых бенчмарках модель достигла 80.3 % SWE‑Bench‑Pro, 94.1 % GPQA и 64.5 % HLE, а её контекстный объём измеряется миллионами токенов.
🎯 Проекты 1 мин
RuStore записывает GPS в SQLite каждые 2 минуты и содержит скрытый бэкдор
Разбор APK RuStore, предустанавливаемого в РФ с 1 апреля 2024 г., показал скрытую подсистему трекинга: координаты сохраняются в локальную SQLite‑базу каждые 2 минуты, а также реализован бэкдор для установки пакетов по push‑команде.
🎯 Проекты 1 мин
🏢 Корпоративное 1 мин
Jeppesen экономит ~2000 инженерных часов с единой чат‑платформой на LlamaIndex
Jeppesen (подразделение Boeing) внедрило единый чат‑фреймворк, построенный на LlamaIndex, и сократило ручные инженерные задачи примерно на 2 000 часов в год. Платформа объединяет внутреннюю техническую документацию и позволяет инженерам получать ответы в режиме реального времени.
🎯 Проекты 1 мин
LlamaIndex добавила ACL‑aware поиск в SharePoint через LlamaParse
LlamaIndex выпустила интеграцию, позволяющую выполнять Retrieval‑Augmented Generation с учётом прав доступа в SharePoint, используя LlamaParse для парсинга и метаданные ACL в индексе.
🎯 Проекты 1 мин
LlamaParse ускорил RAG‑pipeline на 80 % за счёт оптимального размера чанков
В блоге LlamaIndex представлена методика подбора размера чанков для LlamaParse: при размере 512 токенов throughput вырос в 1,8 раз, а latency упала на 30 %. Исследование основано на публичных бенчмарках RAG‑pipeline.
🎯 Проекты 1 мин
Llama‑Agents — открытый фреймворк для продакшн‑мультиагентных систем
LlamaIndex представил Llama‑Agents — набор библиотек, позволяющих собрать масштабируемую мультиагентную архитектуру на базе LLM, включающую планировщик, инструменты и память, готовую к продакшн‑развёртыванию.
🆕 Новые модели 1 мин
LongLLMLingua сокращает промпты на 40 % и экономит до 30 % расходов RAG
LongLLMLingua — новый алгоритм сжатия запросов для RAG‑систем, который уменьшает объём токенов на 40 % без заметного падения качества и снижает стоимость инференса до 30 %.
🎯 Проекты 1 мин
LlamaIndex представила метод тонкой настройки эмбеддингов RAG на синтетических данных
В блоге LlamaIndex описан процесс генерации синтетических запрос‑ответов и последующего fine‑tuning эмбеддингов, который повышает качество Retrieval‑Augmented Generation без необходимости реального аннотированного корпуса.
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
Яндекс Дропс: споттер‑модель помещена в 200 KB
Яндекс представил первую носимую колонку с Алисой AI, где модель споттера (распознавание «Алиса») весит всего 200 KB — рекордный размер для on‑device активации.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
OpenAI анонсировала GPT‑4 Turbo с 128 К контекстом и новые API
OpenAI представила новую модель GPT‑4 Turbo, поддерживающую контекст до 128 000 токенов и обещающую более низкие цены. Также вышла версия GPT‑3.5 Turbo с контекстным окном 16 000 токенов, новые возможности Vision и DALL·E 3 API, а также Assistants API.
🆕 Новые модели 1 мин
Apple выпустила AFM 3 Core Advanced — 20 млрд параметров на iPhone 17 Pro
Apple представила третье поколение Foundation Models. Главная модель AFM 3 Core Advanced содержит 20 млрд параметров и полностью работает на устройстве iPhone 17 Pro, а серверный вариант запускается на NVIDIA GPU.
🎯 Проекты 1 мин
SPQR от Яндекса: шардирование PostgreSQL для петабайтов и сотен тысяч запросов в секунду
Yandex Cloud представила систему SPQR — решение для горизонтального масштабирования PostgreSQL через шардирование. SPQR уже хранит петабайты данных и выдерживает сотни тысяч запросов в секунду, что делает её пригодной для крупных облачных сервисов.
🆕 Новые модели 1 мин
MiniMax M3: 428 B параметров, 23 B активных на токен
MiniMax выпустила модель M3 с MoE‑архитектурой: общий размер ≈ 428 млрд параметров, но при инференсе активируется лишь ~23 млрд параметров на токен благодаря разреженной активации.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
🏢 Корпоративное 1 мин
Китай инвестирует $295 млрд в замену Nvidia на Huawei Ascend 950PR
Китай объявил о пятилетнем проекте национальной сети ИИ‑дата‑центров с бюджетом $295 млрд, где минимум 80 % ИИ‑чипов будет произведено локально. Новый чип Huawei Ascend 950PR в 2,8 раза быстрее Nvidia H20, единственного ускорителя, разрешённого к поставкам в Китай.
🏢 Корпоративное 1 мин
Meta и Reliance открывают 168 MW AI‑дата‑центр в Индии
Meta подписала первое в Индии соглашение о построении AI‑дата‑центра совместно с Reliance. Объём мощности планируемого объекта — 168 мегаватт, и он будет использоваться для глобальных вычислительных нужд Meta. Проект предусматривает возможность дальнейшего расширения.
⚒ Вайбкодинг 2 мин
datasette-agent 0.2a0: интерактивные запросы и сохранение SQL
В релизе 0.2a0 datasette-agent добавлена возможность задавать пользователю вопросы во время выполнения инструмента и новый встроенный инструмент save_query для сохранения сгенерированных SQL‑запросов.
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
GPT‑5.5 набирает 84.9 % на тесте GDPval и получает расширенные кибер‑защиты
OpenAI объявила о выпуске GPT‑5.5, который достиг 84.9 % на бенчмарке GDPval — тесте агентных способностей в 44 профессиях. Для модели внедрены отраслевые кибер‑защиты и открыт доступ через Trusted Access for Cyber для проверенных организаций.
🆕 Новые модели 1 мин
ICLR‑2026 в Рио: 19 000 заявок, 26 % Acceptance Rate, 6 статей Yandex в Main Track
На ICLR‑2026 в Рио‑де‑Жанейро было подано около 19 000 статей, из них более 5 000 прошли рецензирование, что дало уровень одобрения примерно 26 %. Команда Яндекса представила шесть работ в основной программе и одну на воркшопе ICBINB.
🏢 Корпоративное 1 мин
⚒ Вайбкодинг 1 мин
🆕 Новые модели 1 мин
Claude Fable 5 превзошёл Opus 4.8 в тесте уязвимостей: 88,4% vs 8,8%
В system card модели Claude Fable 5 Anthropic указали, что при тесте на эксплуатацию уязвимостей Mythos 5 модель собрала рабочий эксплойт в 88,4 % попыток, тогда как Opus 4.8 достиг лишь 8,8 %. Кроме того, Fable 5 лидирует в закрытом Legal Agent Benchmark с 13,3 % полностью решённых задач.
🆕 Новые модели 1 мин
Claude Fable 5: мультимодальная модель с контекстом 1 000 000 токенов
Anthropic выпустила Claude Fable 5 — модель класса Mythos, поддерживающую ввод текста, изображений и файлов и способную обрабатывать контекст до одного миллиона токенов.
🆕 Новые модели 1 мин
DiffusionGemma: новая модель генерации текста
Google выпустила новую модель генерации текста под названием DiffusionGemma, которая демонстрирует высокую производительность: 857 токенов в секунду и задержку API 4,4 секунды для 2 409 токенов.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
🏢 Корпоративное 1 мин
OpenAI ищет исследователя по киберрискам для разработки mitigation‑stack
OpenAI открыла вакансию Researcher, Frontier Cybersecurity Risks. Кандидат будет проектировать сквозную систему защиты, интегрировать её в продукты с низкой задержкой и масштабировать под рост нагрузки и новые модели.
🎯 Проекты 1 мин
Alpha‑пакет micropython-wasm: sandbox Python в WebAssembly
Simon Willison опубликовал alpha‑версию micropython-wasm — библиотеки, позволяющей выполнять код MicroPython в изолированном окружении WebAssembly и использовать её в плагине datasette-agent-micropython для Datasette Agent.
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
OpenAI выпустила открытые модели gpt-oss-120b и gpt-oss-20b
OpenAI объявила о релизе двух открытых языковых моделей — gpt-oss-120b (120 млрд параметров) и gpt-oss-20b (20 млрд параметров). Обе модели прошли комплексную безопасность и дополнительно оценены в adversarial‑fine‑tuned‑версии gpt-oss-120b по Preparedness Framework.
🆕 Новые модели 1 мин
OpenAI запустил Lockdown Mode для защиты от exfiltration
OpenAI объявил о полном запуске Lockdown Mode, который ограничивает исходящие сетевые запросы в ChatGPT и доступен всем личным аккаунтам, включая бесплатные, а также бизнес‑аккаунтам.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
OpenAI анонсировала GPT‑4 Turbo с контекстом 128 К и новые API для ассистентов
OpenAI представила GPT‑4 Turbo с увеличенным контекстным окном до 128 000 токенов, а также запустила Assistants API, Retrieval и Code Interpreter, добавив поддержку JSON‑режима и функции вызова функций.
🆕 Новые модели 1 мин
🎯 Проекты 1 мин
⚒ Вайбкодинг 2 мин
LangGraph добавил RetryPolicy, TimeoutPolicy и error_handler для продакшн-агентов
В LangGraph появилась встроенная поддержка отказоустойчивости: RetryPolicy с backoff, TimeoutPolicy (wall-clock и idle), и error_handler для cleanup после исчерпания попыток. Материал содержит архитектурные детали и примеры интеграции с SAGA-паттерном.
🎯 Проекты 1 мин
🎯 Проекты 1 мин
TurboVec сжимает векторный индекс до 4 ГБ, ускоряя поиск по сравнению с FAISS
TurboVec — новый open‑source инструмент для хранения векторных индексов, который уменьшает потребление памяти в 16 раз (с 31 ГБ до 4 ГБ) и обеспечивает более быстрый поиск, чем FAISS.
🆕 Новые модели 1 мин
Nvidia RTX Spark: 20‑ядерный ARM‑CPU, >6000 GPU‑ядер, до 128 ГБ общей памяти
Nvidia анонсировала новый чип RTX Spark на базе ARM для Windows‑устройств. В нём 20‑ядерный процессор, более шести тысяч графических ядер и до 128 ГБ объединённой памяти, которую совместно используют CPU и GPU. Первым ноутбуком на этом чипе станет Surface Laptop Ultra.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
🏢 Корпоративное 1 мин
Хакеры получили доступ к Instagram‑аккаунтам через чат‑бот поддержки Meta AI
Хакер запросил у чат‑бота Meta AI привязку новой почты к целевому аккаунту и получил код подтверждения, что позволило выполнить полное восстановление доступа к высокопрофильному Instagram‑профилю.
🆕 Новые модели 1 мин
Qwen 3.7 Max занял 2‑е место в бенчмарке, обойдя GPT‑5.5 Pro по цене
В обновлённом наборе бенчмарков от TimeToAct модель Qwen 3.7 Max оказалась второй в TOP‑20, при этом её стоимость ниже, чем у GPT‑5.5 Pro. Также o1 Pro остаётся лидером по качеству, а DeepSeek V4 Pro и Flash попали в топ‑20 за символическую цену.
🎯 Проекты 1 мин
🎯 Проекты 1 мин
LlamaIndex представила Property Graph Index для построения графов знаний
LlamaIndex выпустила новую структуру индекса – Property Graph Index, позволяющую хранить сущности и их свойства в виде графа и выполнять запросы к нему с помощью LLM.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
MiniMax-M3: мультимодальная модель с контекстом 1 048 576 токенов
Компания MiniMax выпустила модель MiniMax‑M3, поддерживающую ввод текста, изображений и видео и способную обрабатывать контекст до одного миллиона токенов за один проход.
🆕 Новые модели 1 мин
Microsoft представила MAI-Thinking-1 (35B активных) и MAI-Code-1-Flash (5B активных)
Microsoft анонсировала два новых LLM: MAI‑Thinking‑1 с 1 трлн параметров (35 млрд активных) и MAI‑Code‑1‑Flash с 137 млрд параметров (5 млрд активных). Оба модели обучены полностью на лицензированных корпоративных данных без дистилляции и уже доступны ограниченному кругу партнёров и пользователям GitHub Copilot.
🏢 Корпоративное 1 мин
«Зелёный коридор» Сбера: 8 млн ядер, 1,2 ЭБ данных и 27 % текущей загрузки
Проект «Зелёный коридор» в Сбербанке охватывает 8 млн физических ядер, 1,2 экзабайта данных и почти 600 тыс. серверов, при этом фактическая загрузка ресурсов составляет лишь 27 % от потенциальных возможностей.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
Ideogram 4 — 9,3 B‑параметров, открытые веса, работает на 24 GB GPU
Ideogram 4 — генератор изображений с 9,3 млрд параметров, впервые с открытыми весами. Модель доступна в форматах NF4 и FP8 и может работать на одной видеокарте с 24 GB памяти, но лицензия ограничивает коммерческое использование.
🆕 Новые модели 1 мин
Anthropic: контекст задач вырос до 12 ч, модель исправила 800 кода и сократила ошибки в 1000 раз
Anthropic опубликовала данные о рекурсивном самоулучшении: за четыре месяца длительность решаемых задач удваивается, а к 2026 году модель генерирует более 80 % кода, исправив 800 ошибок и снизив количество API‑ошибок в тысячу раз.
🆕 Новые модели 1 мин
NVIDIA Nemotron 3 Ultra: 55 B активных параметров, контекст 1 M токенов
NVIDIA анонсировала модель Nemotron 3 Ultra — гибридную Transformer‑Mamba MoE с 55 млрд активных параметров из 550 млрд общих и поддержкой контекста до 1 млн токенов, ориентированную на сложные рассуждения и оркестрацию агентов.
🆕 Новые модели 1 мин
GPT‑5.5 набирает 84.9 % на GDPval и открывается через Trusted Access
OpenAI объявила о выпуске GPT‑5.5, который достиг 84.9 % точности на тесте GDPval — оценке способностей агентов в 44 профессиях. Модель сопровождается новыми кибер‑защитными мерами и доступна через программу Trusted Access для проверенных организаций.
🆕 Новые модели 1 мин
MiniMax M3: открытая модель с контекстом 1 млн токенов и 66 % Terminal‑Bench 2.1
Компания MiniMax выпустила новую модель M3, открыв её веса для бесплатного локального развертывания. В бенчмарках модель показала 59 % на SWE‑Bench Pro и 66 % на Terminal‑Bench 2.1, а контекстный диапазон достиг 1 млн токенов.
🆕 Новые модели 1 мин
Google выпустила Gemma 4 12B: 12 B параметров, мультимодальная работа на 16 GB RAM
DeepMind опубликовала веса новой модели Gemma 4 12B, способной обрабатывать текст, изображения и аудио в одном потоке без отдельных энкодеров. Модель запускается локально на устройствах с 16 GB оперативной памяти и демонстрирует в бенчмарках показатели уровня 26 B‑класса.
🎯 Проекты 1 мин
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
🎯 Проекты 1 мин
Локальный ИИ‑сервер за 200 000 ₽ с 2× Tesla V100
Автор собрал сервер для инференса на двух видеокартах Tesla V100, уложившись в бюджет 200 000 ₽, и опубликовал бенчмарки 128 моделей от текста до генерации видео.
🆕 Новые модели 1 мин
Grok Imagine Video 1.5 Preview: генерация роликов за $0,14 сек 720p
xAI выпустила Grok Imagine Video 1.5 Preview — модель, генерирующая короткие видеоролики из текста, изображения или их комбинации. Стоимость 720p — $0,14 за секунду плюс $0,01 за входное изображение, лимит 60 запросов в минуту. По результатам Arena ai модель обошла Seedance 2.0, набрав на 52 пункта больше.
🎯 Проекты 1 мин
Yandex Cloud обработал более 13 тыс. меддокументов для регистра ОКС
НМИЦ кардиологии им. Е.И. Чазова совместно с Yandex Cloud запустил цифровой регистр пациентов с острым коронарным синдромом, обработав более 13 тыс. медицинских документов с помощью больших языковых моделей. Смертность в этой группе достигает 20 % за 4 года, что подчёркивает важность раннего мониторинга.
🏢 Корпоративное 1 мин
Anthropic расширила доступ к Claude Mythos для 150 организаций в 15 странах
Anthropic объявила о масштабировании проекта Glasswing и предоставлении модели Claude Mythos 150 организациям в 15 странах, охватывающих критическую инфраструктуру, где потенциальный кибератак может затронуть 100 млн человек.
🎯 Проекты 1 мин
DeltaChannel в LangGraph 1.2 устраняет O(N²) рост хранилища у длительных агентов
LangChain представил новый примитив DeltaChannel в библиотеке LangGraph 1.2, который сохраняет только диффы между шагами и периодически делает полные снимки, обеспечивая постоянные затраты на хранение при росте длительности сессий.
🆕 Новые модели 1 мин
Qwen3.7-Plus: экономичная мультимодальная модель с контекстом 1 000 000 токенов
Alibaba представила Qwen3.7-Plus — экономичный вариант серии Qwen3.7, способный обрабатывать текст и изображения одновременно и поддерживать контекст до одного миллиона токенов.
🎯 Проекты 1 мин
Zero Trust для подрядного доступа: 4‑слойный контур с готовыми скриптами
В статье VK Tech описан практический план построения Zero Trust‑модели для подрядного доступа. На 2025 год почти треть всех ransomware‑инцидентов в России произошла через уязвимости у внешних исполнителей. Авторы предлагают четырёхслойный контур и первые шаги, которые можно реализовать уже за неделю.
🆕 Новые модели 1 мин
Claude Opus 4.8: Fast mode 2.5x быстрее, Effort-настройка ресурсов, сотни субагентов в Claude Code
Anthropic выпустила Claude Opus 4.8 с тремя ключевыми фичами: настраиваемым уровнем вычислительных усилий (Effort), ускоренным режимом Fast mode в 2.5 раза с трёхкратным снижением цены и динамическими воркфлоу в Claude Code с сотнями субагентов. Модель обходит Opus 4.7, GPT-5.5 и Gemini 3.1 Pro в агентном программировании и многошаговом анализе.
🎯 Проекты 1 мин
Datasette Lite переезжает с Web Workers на Service Workers для запуска ASGI в браузере
Simon Willison перевёл Datasette Lite с Web Workers на Service Workers в Pyodide/WebAssembly. Это позволяет запускать Python ASGI-приложения в браузере с полноценным исполнением JavaScript в <code>&lt;script&gt;</code> тегах — ранее это было невозможно.
🎯 Проекты 2 мин
Hermes Agent + DeepSeek V4: open-weights архитектура набрала 81 балл на BitGN ECOM1
Иван Коновалов собрал production-агента на открытых моделях: Nous Hermes Agent для оркестрации, DeepSeek V4 Flash для основных задач и Pro для сложных. Кастомный MCP-сервер и промпт-инженерия позволили поднять результат с 57 до 81 балла на бенчмарке BitGN ECOM1.
🆕 Новые модели 1 мин
NVIDIA Research представила RAG‑систему с 1 Мток контекстом
NVIDIA Research опубликовала исследование, в котором предложена архитектура Retrieval‑Augmented Generation для LLM с контекстным окном в 1 млн токенов. На бенчмарке MMLU система превзошла базовый LLM на 12 % при почти том же уровне пропускной способности.
🏢 Корпоративное 1 мин
Amazon внедрила Resilient Network Graphs: 69% меньше железа, throughput +33%
Amazon объявила о переходе на новую сетевую архитектуру Resilient Network Graphs (RNG) в дата‑центрах AWS. По заявлению компании, RNG сокращает потребность в оборудовании на 69 % и повышает пропускную способность на 33 % по сравнению с традиционными fat‑tree.
🎯 Проекты 1 мин
DeltaChannel в LangGraph 1.2: checkpointing diff вместо полного состояния для долгоживущих агентов
LangGraph 1.2 вводит примитив DeltaChannel, который хранит только diff состояния на каждом шаге, а полные снимки пишет периодически. Это решает проблему O(N²) роста хранилища при чекпоинтинге и включено по умолчанию в Deep Agents v0.6 без миграции.
🎯 Проекты 1 мин
LlamaIndex v0.10: новый API для агентов, переезд на Pydantic v2 и breaking changes
LlamaIndex выпустила мажорную версию 0.10 с переработанным API для агентов, обязательным переходом на Pydantic v2 и новой структурой пакетов. Релиз содержит множество breaking changes, требующих миграции существующих проектов.
🆕 Новые модели 2 мин
GPT-4 vs Prometheus: бенчмарк judge-моделей для RAG-оценки от LlamaIndex
LlamaIndex провели прямое сравнение GPT-4 и open-source модели Prometheus в роли judge для оценки RAG-пайплайнов. Prometheus показал корреляцию 0.9 с человеческими оценками и работает дешевле GPT-4 в 10 раз.
🆕 Новые модели 1 мин
OpenAI DevDay: GPT-4 Turbo с 128K контекстом, Assistants API, Whisper v3
На DevDay OpenAI анонсировала GPT-4 Turbo с контекстным окном 128K токенов, Assistants API для построения агентных приложений, Whisper v3 и снижение цен на API.
🆕 Новые модели 1 мин
OpenAI-модель опровергла гипотезу о расстояниях в дискретной геометрии
Модель OpenAI нашла контрпример к центральной гипотезе о минимальном числе расстояний между точками в R^n. Fields-медалист Тим Гауэрс назвал результат «вехой в AI-математике», а доказательство опубликовано в открытом PDF.
🆕 Новые модели 1 мин
1C Code Bench: бенчмарк для оценки LLM в написании кода на 1С
Сбер AI выпустил 1C Code Bench — специализированный бенчмарк для систематического тестирования LLM на задачах программирования в экосистеме 1С:Предприятие. Это первый публичный инструмент для объективного сравнения моделей в этом домене.
🎯 Проекты 1 мин
4 типа памяти агента: in-context, external, parametric, episodic — архитектуры и trade-off
«Буферная память на всё» — главная причина, почему агент-демо работает, а продакшн разваливается. В посте @big_llm_course структурирован разбор четырёх типов памяти с конкретными архитектурами (RAG, Agentic RAG, GraphRAG) и рецептом лечения типичных провалов.
🆕 Новые модели 1 мин
OpenAI Model Release Notes: хронология от GPT-4o до GPT-5.2 Thinking
Полный реестр релизов OpenAI с ноября 2024 по февраль 2026: от обновлений GPT-4o до GPT-5.2 Thinking и o3-pro. Конкретные даты и версии для планирования миграций.
🆕 Новые модели 1 мин
OpenAI выпускает gpt-oss-120b и gpt-oss-20b — первые open-weight модели
OpenAI анонсировала gpt-oss-120b и gpt-oss-20b — две open-weight языковые модели с публикацией на Hugging Face, model card и research paper. Это первый релиз open-weight моделей от OpenAI с полной документацией и оценкой по Preparedness Framework.
🎯 Проекты 2 мин
LlamaIndex: методология оценки мультимодального RAG с метриками retrieval и generation
LlamaIndex опубликовали детальный разбор методологии оценки мультимодальных RAG-систем. Статья содержит конкретные метрики для retrieval и generation, архитектурные решения для бенчмаркинга и практические рекомендации по построению evaluation-пайплайнов.
🎯 Проекты 1 мин
LlamaIndex v0.10: новый API для агентов и RAG-пайплайнов
LlamaIndex выпустила мажорную версию v0.10 с переработанной архитектурой. Ключевое изменение — унифицированный Workflow API вместо разрозненных классов для построения агентов и RAG-пайплайнов.
🆕 Новые модели 2 мин
GPT-4V: как формулировка вопроса и CoT влияют на точность ответов
LlamaIndex провели серию экспериментов с GPT-4V, сравнивая общие и конкретные вопросы, а также влияние Chain-of-Thought prompting на качество ответов. Результаты показали, что точная формулировка запроса может улучшить точность ответа на 20-30%.
🎯 Проекты 2 мин
Яндекс Еда: год на Temporal в продакшене — архитектура, тестирование и миграции Workflow на Go
Платформа Яндекс Еды перевела процессинг заказов на Temporal и работает так почти год. Разработчик делится практическими советами по детерминизму, тестированию и безопасному развитию Workflow, выведенными из реального опыта миграции.
🆕 Новые модели 1 мин
ITBench-AA: frontier-модели набирают ниже 50% на бенчмарке enterprise IT-агентов
IBM Research и Artificial Analysis представили ITBench-AA — первый бенчмарк для оценки LLM-агентов в реальных enterprise IT-задачах. Лучшие модели (GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro) набрали менее 50% точности на задачах инцидент-менеджмента и настройки инфраструктуры.
⚒ Вайбкодинг 2 мин
Claude Code получил workflows: JS-скрипты для оркестрации агентных пайплайнов
Anthropic добавила в Claude Code примитивы workflows — JS-скрипты с функциями phase(), agent(), parallel() и pipeline() для построения сложных агентных пайплайнов. Встроенный /deep-research уже использует этот механизм: разбивает вопрос на 5 углов, проверяет утверждения тремя независимыми критиками и выбрасывает факты при расхождении 2:1.
🎯 Проекты 1 мин
Python ASGI-приложения в браузере через Pyodide + Service Worker вместо Web Worker
Simon Willison переключил Datasette Lite с Web Worker на Service Worker, решив проблему неисполнения <script>-тегов в Pyodide-приложениях. Решение сгенерировано Claude Opus 4.8 в Claude Code, есть рабочие демо и PR.
🎯 Проекты 2 мин
LongLLMLingua: prompt compression для RAG с экономией до 20× токенов и решением middle loss
LlamaIndex интегрировал LongLLMLingua — алгоритм сжатия промптов, который убирает «middle loss» (потерю информации из середины контекста) и снижает стоимость RAG-запросов. В бенчмарках сжатие достигает 20× при сохранении качества ответов.
Май 2026
🆕 Новые модели 1 мин
🏢 Корпоративное 1 мин
Anthropic раскрыла архитектуру сэндбоксинга: gVisor для Claude.ai, VM для Cowork
Anthropic опубликовала детальный обзор, как изолирует Claude в разных продуктах. В Claude.ai используется gVisor, в Claude Code — Seatbelt/Bubblewrap, а Cowork работает в полной виртуальной машине.
🎯 Проекты 1 мин
LlamaParse v2: новый API, поддержка 50+ форматов, цены от $0.003 за страницу
LlamaIndex выпустила LlamaParse v2 — обновлённый парсер документов для RAG-пайплайнов. Главные изменения: упрощённый API, улучшенное извлечение таблиц и изображений, а также снижение стоимости обработки.
🎯 Проекты 2 мин
LlamaIndex интегрировал Azure Container Apps для безопасного выполнения кода агентов
LlamaIndex добавил поддержку Azure Container Apps Dynamic Sessions для изолированного выполнения кода в агентах. Решение использует сессии с управляемым идентификатором для безопасного доступа к ресурсам Azure без хранения секретов.
🆕 Новые модели 1 мин
LlamaIndex: бенчмарк эмбеддингов и реранкеров для RAG — конкретные модели и метрики
LlamaIndex опубликовали бенчмарк 10+ эмбеддинг-моделей и 5 реранкеров на задачах извлечения для RAG. Лучшие комбинации дают до 15% прироста точности по сравнению с базовым OpenAI ada-002.
🎯 Проекты 1 мин
LlamaIndex: оптимальный размер чанка для RAG — 512 токенов
Исследование LlamaIndex оценило влияние размера чанка на качество ответов RAG-системы. Оптимальный баланс между точностью и скоростью достигается при размере чанка в 512 токенов.
🎯 Проекты 2 мин
LlamaIndex Document Summary Index: индексация по саммари вместо чанков
LlamaIndex выпустил Document Summary Index — новый тип индекса, который вместо нарезки документов на чанки сначала генерирует LLM-саммари по каждому документу, а поиск ведёт по ним. Это снижает количество LLM-вызовов при поиске и улучшает релевантность за счёт понимания контекста всего документа.
⚒ Вайбкодинг 1 мин
Шпаргалка и рецепты Advanced RAG от LlamaIndex: конкретные паттерны для улучшения качества
LlamaIndex опубликовали подробное руководство с конкретными рецептами построения продвинутых RAG-систем. Вместо абстрактных советов — конкретные паттерны, которые можно применить прямо сейчас.
🆕 Новые модели 1 мин
GPT-5.2 Thinking: новый SOTA на GDPval, производительность на уровне эксперта
OpenAI выпустила GPT-5.2 Thinking. Модель установила новый SOTA на бенчмарке GDPval, оценивающем задачи по 44 профессиям, и впервые продемонстрировала производительность на уровне или выше человеческого эксперта.
⚒ Вайбкодинг 1 мин
Microsoft open-sorsит AI Engineering Coach — плагин для анализа 45 анти-паттернов агентного кодинга
Microsoft выпустила open-source плагин AI Engineering Coach. Он анализирует сессии с AI-агентами, считает токены и проверяет 45 анти-паттернов, например, использование дорогих моделей для мелких задач.
🎯 Проекты 1 мин
Nvidia DGX Spark за 400K ₽: 20K фото/мес на Qwen3-VL-32B без обучения
Блогер протестировал Nvidia DGX Spark (128 ГБ RAM, ~90 ГБ под модель) для задач компьютерного зрения в закрытом контуре. На Qwen3-VL-32B-Instruct в полной плотности — ~3 токена/сек, 2 мин на фото, ~20 000 фото в месяц при пакетной обработке через RabbitMQ.
🆕 Новые модели 1 мин
GPT-5 в API: SOTA по оценкам Cursor, Windsurf и Vercel, вдвое меньше ошибок tool calling
OpenAI выпустила GPT-5 для разработчиков через API. Это reasoning-модель, которая, по отзывам, является лучшей для кодинга и агентных задач. Windsurf зафиксировал SOTA на своих бенчмарках и половину частоты ошибок вызова инструментов по сравнению с другими фронтовыми моделями.
🎯 Проекты 1 мин
Perplexity open-sourced Unigram tokenizer: CPU-нагрузка снижена в 5–6 раз
Perplexity опубликовали в open source свой Unigram tokenizer, который снижает нагрузку на CPU в 5–6 раз. Решение адресует узкое место в пайплайнах reranker- и embedding-моделей, где токенизация на CPU становится заметной частью общей задержки.
🆕 Новые модели 1 мин
Claude Opus 4.8: SWE-Bench Pro 69.2%, Dynamic Workflows и «честный» агент
Anthropic выпустила Claude Opus 4.8. Главное: SWE-Bench Pro 69.2% (на 4.9 п.п. выше 4.7), OSWorld 83.4%, GDPval-AA 1890. Модель стала точнее в оценке собственного прогресса и дольше держит контекст в автономном режиме.
🎯 Проекты 1 мин
LlamaIndex выпустила ParseBench — первый бенчмарк парсинга документов для AI-агентов
LlamaIndex представила ParseBench — бенчмарк для оценки качества парсинга документов в RAG-пайплайнах. Бенчмарк оценивает не просто извлечение текста, а точность ответов агента на основе распарсенных документов.
🎯 Проекты 1 мин
Fine-tuning Cohere Reranker через LlamaIndex: +5–10% recall@10 на доменном retrieval
LlamaIndex опубликовал руководство по fine-tuning'у реранкера Cohere на собственных данных. На примере финансовых документов удалось поднять recall@10 с 0.72 до 0.79 — без замены эмбеддинговой модели.
🆕 Новые модели 1 мин
GPT-5: сикофантность снижена вдвое, активированы пороги Preparedness Framework v2
OpenAI выпустила GPT-5. Главное улучшение — сокращение сикофантности более чем вдвое без потери удовлетворённости пользователей. Модель доступна Pro, Plus и Team подписчикам, включая интеграцию с Codex CLI.
🆕 Новые модели 1 мин
GPT-5: 400K контекст, 128K output, $1.25/$10 за 1M токенов
OpenAI выпустила GPT-5 в трёх вариантах — полная модель, mini и nano. Все получили 400K контекст и 128K максимального выхода. Цены: от $0.05 до $10 за 1M токенов.
🎯 Проекты 1 мин
PostgresML + LlamaIndex: реранкинг поднимает recall векторного поиска до 95%
LlamaIndex опубликовал разбор, как добавить реранкинг от PostgresML поверх векторного поиска. Ключевой результат: recall@10 вырос с 0.62 до 0.95 на тестовом наборе, при этом latency увеличилась всего на 40 мс.
🆕 Новые модели 1 мин
RA-DIT: двойной тюнинг LLM и ретривера для улучшения RAG
LlamaIndex описывает архитектуру RA-DIT — метод, который одновременно дообучает и языковую модель, и ретривер на основе взаимных сигналов. Подход показал прирост точности на задачах с открытыми доменами до 5% по сравнению с базовым RAG.
🆕 Новые модели 1 мин
LlamaIndex: fine-tuning линейного адаптера для эмбеддинг-моделей
LlamaIndex опубликовали гайд по fine-tuning линейного адаптера поверх любой эмбеддинг-модели. Приём улучшает retrieval в RAG без переобучения базовой модели — только lightweight-слой на верху.
🎯 Проекты 1 мин
LlamaIndex: пошаговый паттерн QA-системы с оценкой через LLM-as-a-Judge
LlamaIndex опубликовал руководство по созданию QA-системы на RAG с автоматической оценкой качества ответов. Ключевой приём — использование LLM в роли судьи для оценки полноты и релевантности, что заменяет ручную разметку.
🎯 Проекты 2 мин
Delta Weight Sync в TRL: синхронизация триллионных параметров через Hub Bucket
Hugging Face представила Delta Weight Sync — метод синхронизации весов для распределённого обучения триллионных моделей в TRL. Вместо передачи полных чекпоинтов синхронизируются только дельты между итерациями, что снижает объём передаваемых данных на порядки.
🆕 Новые модели 1 мин
Xiaomi снизила цены на модели mimo v2.5 и v2.5-pro до 70%
Xiaomi объявила о снижении стоимости API-доступа к своим языковым моделям mimo v2.5 и v2.5-pro. Максимальное падение цен — на output-токены базовой модели v2.5, стоимость упала с 306 до 43 рублей за миллион токенов.
🆕 Новые модели 1 мин
MoE-вариант Qwen3-VL 30B-A3B ускоряет инференс в 8 раз на DGX Spark
На DGX Spark переход с dense Qwen3-VL-32B на MoE-вариант 30B-A3B дал 8-кратное ускорение: время обработки фото сократилось с 184 до 22 секунд, throughput вырос с 3.7 до 30 ток/с. Точность оценки содержания сохранилась, рамки чуть просели.
🏢 Корпоративное 1 мин
Boeing сэкономил 2000 инженерных часов на едином чат-фреймворке LlamaIndex
Подразделение Boeing Jeppesen внедрило унифицированный чат-фреймворк на базе LlamaIndex для доступа к внутренним данным. Результат — экономия около 2000 инженерных часов за счёт автоматизации рутинных запросов.
🆕 Новые модели 2 мин
LlamaIndex: как улучшить RAG точной настройкой эмбеддингов на синтетических данных
LlamaIndex опубликовал руководство по fine-tuning эмбеддингов для RAG с использованием синтетических данных. Метод позволяет поднять качество retrieval на специфичных доменах без ручной разметки.
🆕 Новые модели 1 мин
GPT-5.4: 83% на GDPval, tool search в API и open-source оценка CoT
OpenAI выпустила GPT-5.4 — модель превзошла GPT-5.2 на бенчмарке GDPval с 83% против 70.9% и получила новый API-инструмент tool search для эффективной работы с множеством инструментов.
🆕 Новые модели 1 мин
Google выпустила Gemini 3.5 Flash с контекстом 1M токенов и мультимодальностью
Google представила модель Gemini 3.5 Flash с контекстом 1 048 576 токенов и полной мультимодальностью. Позиционируется как производительность Pro-класса при стоимости и скорости Flash-серии.
🎯 Проекты 2 мин
Яндекс: как построить AI Chat для интранета на базе поиска и снизить галлюцинации
Команда Яндекс Infrastructure описала архитектуру внутреннего AI-чата для корпоративного интранета. Система построена на базе существующего поиска, а для снижения галлюцинаций используется гибридное ранжирование и фича-инжиниринг контекста. Внедрение подтверждено A/B-тестами.
⚒ Вайбкодинг 1 мин
Claude Code: sandboxing с bubblewrap/seatbelt снял 84% запросов на одобрение
Anthropic описала архитектуру безопасности Claude Code: агент работает в песочнице с двойной изоляцией — по файлам и сети. Подход снял 84% запросов на подтверждение действий.
🆕 Новые модели 1 мин
Gemini 3.5 Flash: 83.6% на MCP Atlas, обходит 3.1 Pro и конкурирует с GPT-5.5
Google представила Gemini 3.5 Flash на I/O. Модель показывает 83.6% на агентном бенчмарке MCP Atlas и 76.2% на Terminal-Bench 2.1, обходя предыдущую Pro-версию и конкурируя с GPT-5.5.
🎯 Проекты 1 мин
LangGraph Server автоматически поднимает REST API для локальной LLM на 16 ГБ VRAM
Selectel опубликовал вторую часть гайда по запуску облачной LLM на 16 ГБ VRAM. В этот раз — построение графовой инфраструктуры LangGraph с автоматическим созданием REST API, трейсингом в LangSmith и SDK для разработки.
🆕 Новые модели 1 мин
Google SensorFM: foundation-модель на 1 трлн минут данных с фитнес-браслетов
Google обучила SensorFM на данных от 5 млн человек. Модель сначала выучивает структуру физиологических сигналов, а затем переиспользует представление для предсказаний по кардиологии, метаболизму и сну. На 34 из 35 задач эмбеддинги превзошли ручные признаки.
🎯 Проекты 1 мин
BitGN ECOM1: 105 пользователей, 62.8k прогонов агентов, 8.41M Tool Calls за 7 дней
30 мая стартует бенчмарк ECOM1 для оценки AI-агентов. Платформа уже показала масштаб: 105 пользователей за 7 дней совершили 62.8k прогонов, сгенерировав 8.41M вызовов инструментов и 1.35 лет агентского времени.
🏢 Корпоративное 1 мин
Anthropic платит SpaceX $1.25 млрд/мес за compute в COLOSSUS до мая 2029
SpaceX раскрыла в S-1 контракт с Anthropic: $1.25 млрд ежемесячно за доступ к compute-мощностям COLOSSUS и COLOSSUS II. Соглашение действует до мая 2029 года с возможностью расторжения за 90 дней.
🆕 Новые модели 1 мин
GPT-5-mini: 1200 reasoning-токенов за 13.9 секунды, TTFT 249 мс
Лог API-ответа от модели openai/gpt-5-mini показывает конкретные метрики инференса: 1200 completion_tokens (все reasoning), 3188 prompt_tokens (из них 3072 кешированы), latency 13.9 секунд и TTFT 249 мс. Ответ обрезан по лимиту длины.
🆕 Новые модели 2 мин
NVIDIA релизила Nemotron-Labs Diffusion LMs: генерация текста со скоростью света
NVIDIA опубликовала на Hugging Face семейство языковых моделей на основе диффузионной архитектуры (DLM). Ключевое обещание — генерация текста со скоростью, приближенной к скорости света, за счёт параллельного предсказания всех токенов одновременно.
🎯 Проекты 1 мин
Яндекс: LLM-изация интранет-поиска с A/B-тестами и архитектурой ранжирования
Команда Yandex Infrastructure детально разобрала процесс интеграции LLM в корпоративный поиск по интранету. В статье обещаны цифры из реальных A/B-экспериментов и архитектура перехода от классического ранжирования к генеративной Q&A-системе.
🎯 Проекты 1 мин
datasette-agent-charts 0.1a1: тултипы, observable10 и проверки прав
Вышел релиз datasette-agent-charts 0.1a1. Обновление добавляет интерактивные тултипы, палитру observable10 для текстовых значений и проверку прав execute-sql перед инспекцией колонок.
🏢 Корпоративное 1 мин
Anthropic платит SpaceX $1,25 млрд в месяц за вычисления
Anthropic заключила контракт с SpaceX на поставку вычислительных мощностей стоимостью $1,25 млрд в месяц, что составляет $15 млрд в год. Детали сделки раскрыты в документах IPO SpaceX.
🆕 Новые модели 1 мин
Gemini 3.5 Flash: 83.6% на MCP Atlas, обходит 3.1 Pro в агентных задачах
Google представила Gemini 3.5 Flash на I/O. Модель показала 83.6% на бенчмарке многошаговых агентных задач MCP Atlas и 76.2% на Terminal-Bench 2.1, обогнав Gemini 3.1 Pro и конкурируя с GPT-5.5.
🎯 Проекты 1 мин
Wordstat API Яндекса вышел в GA: агрегация по месяцам/неделям/дням и региональная аналитика
Яндекс анонсировал выход Wordstat API в стадию General Availability. API предоставляет программный доступ к статистике поисковых запросов с возможностью агрегации по месяцам, неделям и дням, а также региональной аналитикой.
🎯 Проекты 1 мин
LangGraph 1.2: DeltaChannels снижают рост хранилища с O(N²) до константы
В LangGraph 1.2 появился примитив DeltaChannel, оптимизирующий хранение состояния долгоживущих агентов. Вместо полных снапшотов система записывает только диффы, делая расходы на хранилище константными вне зависимости от длины сессии.
🆕 Новые модели 2 мин
Google SensorFM: foundation model для сенсорных данных с тела обучена на 1+ трлн минут
Google выпустила SensorFM — foundation model для данных с носимых устройств. Обучена на 1+ триллионе минут сырых сенсорных сигналов от 5 млн человек. Эмбеддинги модели обошли ручной фичеринг на 34 из 35 предсказательных задач.
🆕 Новые модели 1 мин
🏢 Корпоративное 1 мин
Anthropic платит SpaceX $1.25 млрд/мес за доступ к COLOSSUS II
В S-1 документе SpaceX раскрыта сделка с Anthropic: компания получает $1.25 млрд ежемесячно за предоставление вычислительных мощностей кластеров COLOSSUS и COLOSSUS II. Контракт действует до мая 2029 года.
🆕 Новые модели 1 мин
🆕 Новые модели 1 мин
В чате недавно обсуждали, на что использовать оставшиеся свободные tokens в подп
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
Продуктовый инженер (Vibe Coder)
Краткое описание события одним-двумя предложениями для карточки хаба.
⚒ Вайбкодинг 1 мин
Запилил мини-игру за час, закинул в Github Actions, прокинул в Telegram Mini App
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
💬 5 промтов, чтобы забить отложку на неделю/месяц вперёд.
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
Google Search an agent🔋
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
**BitGN Live лидерборды теперь учитывают время прогона
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
Пишете промпт, получаете плохой ответ, ругаетесь с нейросетью и всё переделывает
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
ECOM1 получил продолжение на второй сезон!
Краткое описание события одним-двумя предложениями для карточки хаба.
🏢 Корпоративное 1 мин
We’re announcing new community investments in Missouri.
Краткое описание события одним-двумя предложениями для карточки хаба.
🆕 Новые модели 1 мин
100 things we announced at I/O 2026
Краткое описание события одним-двумя предложениями для карточки хаба.