Исследователи провели систематическое изучение того, как отдельные компоненты каркаса (harness) влияют на производительность автономных агентов при написании кода. Тестирование 176 конфигураций на бенчмарках SWE-Bench и Terminal-Bench показало, что управление контекстом, планирование и выбор действий по-разному влияют на эффективность в зависимости от способностей модели.
Исследователи предложили архитектуру языковой модели, которая генерирует веса нейронной сети прямо из данных взаимодействия с пользователем вместо того, чтобы хранить их в памяти. Благодаря компактной гиперсети, модель может эффективно адаптироваться к новой информации во время сессии, не требуя переобучения.
Как эмулировать строгую модель памяти x86 на слабых ARM архитектурах: разбор проблем с производительностью, от базовых load/store операций до атомарных инструкций и работы с несогласованной памятью.
PrismML выпустила Ternary Bonsai 2 27B — модель нейросети на базе Qwen3.8 27B с тернарными весами {−1, 0, +1}, уменьшенная в 9 раз до 5,9 ГБ при сохранении 98,2% производительности оригинала. Модель поддерживает контекст на 262K токенов, включает мультимодальный ввод текста и изображений и распространяется под лицензией Apache 2.0.
Исследователи Intel разработали BITCOS — новый формат хранения весов для тернарных языковых моделей, который учитывает реальное распределение символов в модели. Метод позволяет достичь 1.485 бита на вес и повысить производительность инференса на CPU и GPU.
DeepSeek V4.1 Flash добилась результата 11 из 11 в бенчмарке по поиску уязвимостей. Аудит показал, что модель не только нашла все запланированные уязвимости, но и обнаружила пять неожиданных путей эксплуатации, что привело к улучшению самого теста.
Google опубликовал открытый исходный код реализации Quicksort, которая сортирует массивы примерно в 10 раз быстрее, чем стандартная библиотека C++, и работает на всех современных архитектурах процессоров благодаря применению SIMD инструкций.
Фронтальные лаборатории переоценены относительно своих возможностей: текущие модели требуют постоянного надзора даже для простых задач, обобщают знания только в узком пространстве обученных примеров и уязвимы для скрытого манипулирования вознаграждениями. Автономные системы остаются фантазией для большинства реальных применений.
TypeSafe анонсировала первую публичную модель Jev класса System One — нейросеть, оптимизированная для структурированных решений вместо генерации текста. Она работает в 20–200 раз быстрее существующих LLM при сопоставимом качестве и стоит в 40–400 раз дешевле, со скоростью ответа 70–500 мс вместо 3–329 секунд.
Сравнение дешёвой модели GPT-5.6 Luna (0,20/$1,20 за млн токенов) и премиум GPT-6 Astra ($10/$50) на задаче review кода: Luna нашла 69 проверенных багов против 92 у Astra, потратив всего $0,20 вместо $5,66. Но с задачами по безопасности результаты кардинально отличаются.
JPEG XL — технически впечатляющий кодек, но для веб-платформы он не предлагает убедительных преимуществ перед AVIF. Практический анализ сжатия, скорости декодирования и реальных потребностей веб показывает, что JPEG XL лучше подходит для специализированных задач вне браузера.
Какая видеопамять нужна для запуска Qwen3.8 27B без потери качества? Модель в полной точности BF16 весит 55 ГБ, а Q4_K_M в 17 ГБ показывает такие же результаты на бенчмарках, помещаясь на RTX 4090. При сжатии до 1 бита модель падает на уровень случайных угадываний.