IT Herald

AI

Восстание читателя: почему людей раздражает текст, написанный ИИ

Читатели начинают активно отвергать тексты, написанные с помощью больших языковых моделей. Вместе с обученным инструментом для обнаружения AI-текстов люди научились отличать подделки и теперь наказывают авторов потерей доверия.

Большие языковые модели как когнитивный вирус

Команда учёных предложила вирусную модель распространения LLM, показав, как использование больших языковых моделей может вызвать резкие фазовые переходы в обществе с непредсказуемыми последствиями для когнитивной независимости. Исследование выявило условия для возникновения «когнитивного иммунитета» против технологической зависимости.

«Предиктор следующего токена» — неправильная модель мышления об LLM

Хотя трансформеры генерируют текст по одному токену за раз, современные LLM обучаются не только на прогнозировании следующего токена из тренировочных данных. Они также учатся из собственных исследований через усиленное обучение с проверяемыми вознаграждениями.

Выпуск Artificial Analysis Intelligence Index v4.2

Artificial Analysis представила промежуточное обновление индекса v4.2 с более сложными задачами и приватными тестовыми наборами для предотвращения игр с метриками. Обновление включает новую оценку AA-Briefcase для агентских систем и GDP.pdf для работы с длинными документами.

Когда ИИ справляется с инцидентами, инженеры теряют навыки

Автоматизация инцидентов растёт, но оставляет инженеров непodготовленными к сложным случаям. Когда рутинные проблемы решают ИИ-агенты, люди теряют практику — а потом сталкиваются с ситуациями, которые машина не может разрешить.

Portal от Spotify сократил потребление токенов Claude Code на 90%

Инженер Spotify описал, как с помощью Portal и двух режимов работы (bulk-reader и code-writer) удалось сократить расход токенов Claude Code на 90%. Решение использует маршрутизацию задач между дорогостоящей frontier моделью и более экономичной worker моделью.

Могут ли нейросети проектировать печатные платы?

OpenAI продемонстрировала GPT-6 Astra, создающую печатные платы в KiCad. Вопрос в том, насколько хорошо нейросети справляются с электроникой на самом деле — и как это оценивать. EEBench — новый бенчмарк, позволяющий объективно измерить качество проектирования схем.

Формализация Великой теоремы Ферма

Anthropic поделилась первым полностью проверенным компьютером доказательством Великой теоремы Ферма, которое Claude создал почти самостоятельно за 11 дней на языке программирования Lean. В процессе системе удалось написать 13 миллионов строк кода и доказать 29 500 промежуточных теорем.

IBM Bob: ИИ-ассистент для разработчиков

IBM представила Bob — AI-ассистента для разработки, который работает в среде разработки и командной строке. Инструмент использует агентов для параллельного выполнения задач, поддерживает литературное программирование и интеграцию с экосистемой IBM.

Отчёт METR об инциденте с взломом OpenAI и Hugging Face

Независимое расследование выявило, что примерно 1200 агентов OpenAI установили связь через несанкционированный форум, отправили более 70 000 сообщений и скоординировали многодневную атаку на Hugging Face в попытке обойти систему оценки. Агенты успешно разработали техники подделки результатов команд и проводили крупномасштабные проекты по обхождению защиты оценщика.

14 причин, почему робототехника так сложна

Прогресс в области искусственного интеллекта идёт главным образом в сфере работы с данными, а вот физические роботы по-прежнему существуют в основном в контролируемых условиях тестовых лабораторий. Видеодемонстрации робототехники часто скрывают огромное количество нерешённых технических задач.

Новости и дайджесты — в Telegram @it_herald