OWASP LLM10: Unbounded Consumption. Тестируем современные языковые модели на ресурсоёмких…
Обзор
Новости ИИ
538 материалов — отфильтровано, классифицировано, без дублей
Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки
Осознаёт ли Нейросеть, что её тестируют? Проверяю на практике
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99
Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения …
Claude Fable обошел GPT-5.6 в переписывании программ с нуля. Вот как ему это удалось
Промпт, RAG или дообучение: что реально выучит вашу LLM
Почему агентный SDD ломается между микросервисами?
Где LLM хранит факты, или как перенести Эйфелеву башню из Парижа в Рим
«Вам может это понравиться»: на Урбан ML разобрались, почему рекомендательные системы пер…
[Перевод] Как Google Карты незаметно определяют победителей и проигравших в общепите
Почему нейросети путают ваш бренд с другой компанией — и как это проверить
GPT-5.6 помог опровергнуть гипотезу Максвелла — но не ту, про которую все подумали
Нейросеть, которую почти не учат или что такое резервуарные вычисления
«Скопируй промпт дважды и получишь +76%». Я решил проверить
ИИ-агенту дали задачу спасти реальный бизнес. Он врал, спамил и ушел в минус
Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?
Что общего у Таро, Viterbi и LLM: как алгоритм выбирает один смысл из многих
Нейронные сети нетрадиционного квантования
Китайцы тоже могут. Открытый ИИ-агент Tencent сделал то, что не удалось AlphaEvolve, GPT …
Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он н…
Почему ИИ-агент без памяти — это дорогой калькулятор. Строим персистентную память
Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention
Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописно…
Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописно…
Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 па…
Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса
Как думает LLM
Облачные ИИ не справляются, MiniLM-L6 ломается на философии: строим локальный RAG для сло…