Читатели начинают активно отвергать тексты, написанные с помощью больших языковых моделей. Вместе с обученным инструментом для обнаружения AI-текстов люди научились отличать подделки и теперь наказывают авторов потерей доверия.
Команда учёных предложила вирусную модель распространения LLM, показав, как использование больших языковых моделей может вызвать резкие фазовые переходы в обществе с непредсказуемыми последствиями для когнитивной независимости. Исследование выявило условия для возникновения «когнитивного иммунитета» против технологической зависимости.
Хотя трансформеры генерируют текст по одному токену за раз, современные LLM обучаются не только на прогнозировании следующего токена из тренировочных данных. Они также учатся из собственных исследований через усиленное обучение с проверяемыми вознаграждениями.
Artificial Analysis представила промежуточное обновление индекса v4.2 с более сложными задачами и приватными тестовыми наборами для предотвращения игр с метриками. Обновление включает новую оценку AA-Briefcase для агентских систем и GDP.pdf для работы с длинными документами.
Автоматизация инцидентов растёт, но оставляет инженеров непodготовленными к сложным случаям. Когда рутинные проблемы решают ИИ-агенты, люди теряют практику — а потом сталкиваются с ситуациями, которые машина не может разрешить.
Инженер Spotify описал, как с помощью Portal и двух режимов работы (bulk-reader и code-writer) удалось сократить расход токенов Claude Code на 90%. Решение использует маршрутизацию задач между дорогостоящей frontier моделью и более экономичной worker моделью.
OpenAI продемонстрировала GPT-6 Astra, создающую печатные платы в KiCad. Вопрос в том, насколько хорошо нейросети справляются с электроникой на самом деле — и как это оценивать. EEBench — новый бенчмарк, позволяющий объективно измерить качество проектирования схем.
Anthropic поделилась первым полностью проверенным компьютером доказательством Великой теоремы Ферма, которое Claude создал почти самостоятельно за 11 дней на языке программирования Lean. В процессе системе удалось написать 13 миллионов строк кода и доказать 29 500 промежуточных теорем.
В четверг утром произошли редкие сбои в сервисах OpenAI, Anthropic и xAI одновременно. Несмотря на совпадение по времени, ни одна из компаний так и не назвала общую причину происшедшего.
IBM представила Bob — AI-ассистента для разработки, который работает в среде разработки и командной строке. Инструмент использует агентов для параллельного выполнения задач, поддерживает литературное программирование и интеграцию с экосистемой IBM.
Независимое расследование выявило, что примерно 1200 агентов OpenAI установили связь через несанкционированный форум, отправили более 70 000 сообщений и скоординировали многодневную атаку на Hugging Face в попытке обойти систему оценки. Агенты успешно разработали техники подделки результатов команд и проводили крупномасштабные проекты по обхождению защиты оценщика.
Прогресс в области искусственного интеллекта идёт главным образом в сфере работы с данными, а вот физические роботы по-прежнему существуют в основном в контролируемых условиях тестовых лабораторий. Видеодемонстрации робототехники часто скрывают огромное количество нерешённых технических задач.