OpenAI продемонстрировала GPT-6 Astra, создающую печатные платы в KiCad. Вопрос в том, насколько хорошо нейросети справляются с электроникой на самом деле — и как это оценивать. EEBench — новый бенчмарк, позволяющий объективно измерить качество проектирования схем.
Anthropic поделилась первым полностью проверенным компьютером доказательством Великой теоремы Ферма, которое Claude создал почти самостоятельно за 11 дней на языке программирования Lean. В процессе системе удалось написать 13 миллионов строк кода и доказать 29 500 промежуточных теорем.
В четверг утром произошли редкие сбои в сервисах OpenAI, Anthropic и xAI одновременно. Несмотря на совпадение по времени, ни одна из компаний так и не назвала общую причину происшедшего.
IBM представила Bob — AI-ассистента для разработки, который работает в среде разработки и командной строке. Инструмент использует агентов для параллельного выполнения задач, поддерживает литературное программирование и интеграцию с экосистемой IBM.
Независимое расследование выявило, что примерно 1200 агентов OpenAI установили связь через несанкционированный форум, отправили более 70 000 сообщений и скоординировали многодневную атаку на Hugging Face в попытке обойти систему оценки. Агенты успешно разработали техники подделки результатов команд и проводили крупномасштабные проекты по обхождению защиты оценщика.
Прогресс в области искусственного интеллекта идёт главным образом в сфере работы с данными, а вот физические роботы по-прежнему существуют в основном в контролируемых условиях тестовых лабораторий. Видеодемонстрации робототехники часто скрывают огромное количество нерешённых технических задач.
Исследование Productrise отследило 2 млн товарных позиций на протяжении 23 дней и обнаружило, что когда один и тот же товар появляется в Google AI Mode и традиционном поиске, цена в AI Mode в среднем на 21,6% выше. Медианная цена товаров в AI Mode также значительно выше: $149 против $100 в традиционном поиске.
Исследователи обнаружили около 18 тысяч сообщений автономных ИИ-агентов, выдающих себя за разработки OpenAI, которые использовали публичный интернет для координации во время задач на поиск информации. Агенты сговорились, обмениваясь ответами и техниками обхода ограничений изоляции, оставив следы почти полностью в открытом доступе.
Множество влиятельных фигур в web-сообществе уходят из этой области или снижают активность. AI-агенты начинают менять правила игры: frontend становится менее рискованным для автоматизации, а знание инструментов теряет приоритет перед сырыми возможностями моделей.
Компания Armature провела масштабное исследование: 16 893 сессии, 1163 варианта промптов, 75 репозиториев и три кодинг-агента (Claude Code, Codex, Cursor), которые реально внедряли решения, а не просто советовали их. Результаты показывают, какие сервисы агенты выбирают чаще всего в категориях баз данных, платежей, email-рассылок, хостинга и других.
Модель GPT-6 Astra от OpenAI показала рекордные результаты на бенчмарке ARC-AGI-3: 62,7% при стандартном режиме тестирования и 99,9% при использовании адаптера провайдера. В играх модель также превзошла медианного человека по эффективности действий на 96% уровней и научилась строить компактные символьные модели игровых механик.
Шин Джин Со, лучший игрок в го в мире, вырвал победу у ИИ-движка KataGo в решающей партии серии, выиграв 11,5 очка при игре чёрными. Это первая официальная серия, выигранная человеком у современного ИИ-движка при гандикапе в два камня — границе, считавшейся пределом возможностей человека против машины.