IT Herald

Benchmark

Проектирование каркаса для AI-кодировщиков: эмпирическое исследование компонентов

Исследователи провели систематическое изучение того, как отдельные компоненты каркаса (harness) влияют на производительность автономных агентов при написании кода. Тестирование 176 конфигураций на бенчмарках SWE-Bench и Terminal-Bench показало, что управление контекстом, планирование и выбор действий по-разному влияют на эффективность в зависимости от способностей модели.

Языковые модели с бесконечным числом параметров: генерация и адаптация весов на основе живых данных

Исследователи предложили архитектуру языковой модели, которая генерирует веса нейронной сети прямо из данных взаимодействия с пользователем вместо того, чтобы хранить их в памяти. Благодаря компактной гиперсети, модель может эффективно адаптироваться к новой информации во время сессии, не требуя переобучения.

Бич x86 эмуляции

Как эмулировать строгую модель памяти x86 на слабых ARM архитектурах: разбор проблем с производительностью, от базовых load/store операций до атомарных инструкций и работы с несогласованной памятью.

Представляем Bonsai 2 27B: почти безвредная компрессия в 9 раз меньшем объёме

PrismML выпустила Ternary Bonsai 2 27B — модель нейросети на базе Qwen3.8 27B с тернарными весами {−1, 0, +1}, уменьшенная в 9 раз до 5,9 ГБ при сохранении 98,2% производительности оригинала. Модель поддерживает контекст на 262K токенов, включает мультимодальный ввод текста и изображений и распространяется под лицензией Apache 2.0.

Преодоление барьера 1.58 бита для тернарных LLM

Исследователи Intel разработали BITCOS — новый формат хранения весов для тернарных языковых моделей, который учитывает реальное распределение символов в модели. Метод позволяет достичь 1.485 бита на вес и повысить производительность инференса на CPU и GPU.

DeepSeek V4.1 Flash — лучшая модель для поиска уязвимостей

DeepSeek V4.1 Flash добилась результата 11 из 11 в бенчмарке по поиску уязвимостей. Аудит показал, что модель не только нашла все запланированные уязвимости, но и обнаружила пять неожиданных путей эксплуатации, что привело к улучшению самого теста.

Векторизованный и портативный по производительности Quicksort

Google опубликовал открытый исходный код реализации Quicksort, которая сортирует массивы примерно в 10 раз быстрее, чем стандартная библиотека C++, и работает на всех современных архитектурах процессоров благодаря применению SIMD инструкций.

Почему я остаюсь скептиком в отношении LLM даже после Navier-Stokes

Фронтальные лаборатории переоценены относительно своих возможностей: текущие модели требуют постоянного надзора даже для простых задач, обобщают знания только в узком пространстве обученных примеров и уязвимы для скрытого манипулирования вознаграждениями. Автономные системы остаются фантазией для большинства реальных применений.

Представляем System One Models и Jev: модели в 40–400 раз дешевле и в 20–200 раз быстрее

TypeSafe анонсировала первую публичную модель Jev класса System One — нейросеть, оптимизированная для структурированных решений вместо генерации текста. Она работает в 20–200 раз быстрее существующих LLM при сопоставимом качестве и стоит в 40–400 раз дешевле, со скоростью ответа 70–500 мс вместо 3–329 секунд.

GPT-5.6 Luna vs GPT-6 Astra: достаточно ли модели за $1,20 для ревью кода?

Сравнение дешёвой модели GPT-5.6 Luna (0,20/$1,20 за млн токенов) и премиум GPT-6 Astra ($10/$50) на задаче review кода: Luna нашла 69 проверенных багов против 92 у Astra, потратив всего $0,20 вместо $5,66. Но с задачами по безопасности результаты кардинально отличаются.

Аргументы против JPEG XL в веб

JPEG XL — технически впечатляющий кодек, но для веб-платформы он не предлагает убедительных преимуществ перед AVIF. Практический анализ сжатия, скорости декодирования и реальных потребностей веб показывает, что JPEG XL лучше подходит для специализированных задач вне браузера.

Бенчмарк квантизаций Qwen3.8 27B: 4-бит держит, 1-бит падает

Какая видеопамять нужна для запуска Qwen3.8 27B без потери качества? Модель в полной точности BF16 весит 55 ГБ, а Q4_K_M в 17 ГБ показывает такие же результаты на бенчмарках, помещаясь на RTX 4090. При сжатии до 1 бита модель падает на уровень случайных угадываний.

Новости и дайджесты — в Telegram @it_herald