ИИ за последние месяцы решил несколько математических гипотез, открытых десятилетиями. Калифорнийский технологический институт организует первый хакатон, посвящённый исследовательской математике, где сотня команд будет решать открытые гипотезы с помощью фронтальных моделей ИИ.
Персональный взгляд на феномен искусственного интеллекта — от удивления его возможностями до опасений по поводу влияния на общество. Смесь надежд и тревог разработчика, наблюдающего кардинальную трансформацию отрасли.
Во многих крупных компаниях сотни приложений и тысячи автоматизаций, но огромное количество рутинных задач по-прежнему выполняется вручную. AI обещает радикально упростить создание инструментов автоматизации, однако реальные процессы трансформации компаний гораздо сложнее.
Брайан Кентрилл критикует растущую тенденцию использования LLM для генерации контента в социальных сетях. Текст, написанный нейросетями, легко узнать по характерным стилистическим ошибкам, что подрывает доверие к автору и заставляет читателей прекратить чтение.
Исследователи протестировали GPT-6 Astra на управлении роботизированными манипуляторами в двух задачах захвата и размещения предметов. На простой задаче размещения кубика Astra показала 95% успешность против 40% у Claude Fable 5.1, при этом работая быстрее и дешевле.
Читатели начинают активно отвергать тексты, написанные с помощью больших языковых моделей. Вместе с обученным инструментом для обнаружения AI-текстов люди научились отличать подделки и теперь наказывают авторов потерей доверия.
Команда учёных предложила вирусную модель распространения LLM, показав, как использование больших языковых моделей может вызвать резкие фазовые переходы в обществе с непредсказуемыми последствиями для когнитивной независимости. Исследование выявило условия для возникновения «когнитивного иммунитета» против технологической зависимости.
Хотя трансформеры генерируют текст по одному токену за раз, современные LLM обучаются не только на прогнозировании следующего токена из тренировочных данных. Они также учатся из собственных исследований через усиленное обучение с проверяемыми вознаграждениями.
Artificial Analysis представила промежуточное обновление индекса v4.2 с более сложными задачами и приватными тестовыми наборами для предотвращения игр с метриками. Обновление включает новую оценку AA-Briefcase для агентских систем и GDP.pdf для работы с длинными документами.
Автоматизация инцидентов растёт, но оставляет инженеров непodготовленными к сложным случаям. Когда рутинные проблемы решают ИИ-агенты, люди теряют практику — а потом сталкиваются с ситуациями, которые машина не может разрешить.
Инженер Spotify описал, как с помощью Portal и двух режимов работы (bulk-reader и code-writer) удалось сократить расход токенов Claude Code на 90%. Решение использует маршрутизацию задач между дорогостоящей frontier моделью и более экономичной worker моделью.
OpenAI продемонстрировала GPT-6 Astra, создающую печатные платы в KiCad. Вопрос в том, насколько хорошо нейросети справляются с электроникой на самом деле — и как это оценивать. EEBench — новый бенчмарк, позволяющий объективно измерить качество проектирования схем.