Модели знают об электронике больше, чем может показаться

Современные модели действительно разбираются в электронике гораздо лучше, чем видно по их результатам в традиционных инструментах проектирования. Они изучили учебники, техническую документацию компонентов, аппликативные заметки и огромное количество кода.

Когда агент работает с графическими CAD-инструментами, он тратит много времени на навигацию по интерфейсу и отслеживание состояния экрана. Большая часть его контекста — координаты, меню и состояние приложения.

EEBench использует atopile иначе. Схема находится в декларативном коде, поэтому агент может работать напрямую с компонентами, соединениями и электрическими ограничениями. Он может менять дизайн, собирать его, запускать симуляции и проверять ошибки, не покидая проекта.

Такой подход показал себя куда лучше, чем просьба модели рисовать линии в GUI. Бенчмарк тратит меньше времени на проверку компьютерных навыков и больше на проверку собственно электроники.

Фрагмент стартовой конструкции для одной из публичных задач EEBench на языке ato v2
.ELEC: @STD::Import {
    .project &= "electronics"
    .org     &= "atopile"
}

.Submission: @type {
    .vin:   ELEC::ElectricPower
    .vhold: ELEC::ElectricPower
    .vhold.lv ~ .vin.lv

    .c_bank: ELEC::Capacitor {
        .capacitance             &= 22uF +/- 20%
        .max_voltage             &= 10V..25V
        .temperature_coefficient &= "X5R"
        .package                 &= "0805"
    }

    .vhold.hv ~> .c_bank ~> .vhold.lv
}

Реальный мир — сложнее

Одна из публичных задач основана на жилом счётчике электроэнергии. Когда 5-вольтовое питание исчезает, схема должна держать процессор живым ещё 20 мс, чтобы он успел сохранить накопленные данные. Защищённая шина должна оставаться выше порога входа режима отказа процессора (3,0 В) на протяжении всего этого окна.

Большинство моделей интуитивно приходят к правильному выводу: добавить конденсатор.

Реальный конденсатор делает задачу интереснее. Керамический компонент может дать намного меньше ёмкости, чем написано на корпусе, если через него приложено напряжение. У деталей есть допуски. Добавление большей ёмкости дорожает, требует места и замедляет восстановление шины при возврате питания. Дизайн, работающий с номинальными значениями, может отказать с приходящими в реальности деталями.

EEBench отключает входное питание в симуляции и смотрит, что происходит. Проверяет напряжение на протяжении всей работы без питания, эффективную ёмкость в точке работы, восстановление после возврата питания и ограничения по размеру корпуса, диэлектрику, номиналу напряжения и стоимости.

Счётчик энергии — одна из более простых задач. В более сложном аналоговом задании агент может потребоваться синтезировать многозвенный низкочастотный фильтр на операционном усилителе, решить соотношения резисторов и конденсаторов для требуемых полюсов и удержать усиление, частоту среза и добротность в пределах лимитов при достижении каждого компонента к экстремальным допускам. Система перестраивает SPICE-подобие для этих углов, запускает AC и транзиентные съёмки, связывает измерения с именованными щупами и записывает каждый результат по отношению к его нижнему и верхнему пределам спецификации.

Но получить правильные уравнения — это только часть электротехнической инженерии. EEBench использует реальные компоненты производителей со спецификациями из их даташитов, перенесённые в SPICE-модель. Агент должен найти комбинацию, которая работает во всех углах допусков, одновременно выбирая детали, которые существуют, могут быть заказаны и имеют разумную цену для продукта. Компромисс между электрическими характеристиками, стоимостью и доступностью намного ближе к проектированию реальной аппаратуры, чем выбор идеальных значений из учебника.

Это самое интересное, потому что именно это в итоге и составляет электротехническую инженерию — компромиссы, как и во всех других инженерных дисциплинах.

Как работает оценка

Проверки EEBench полностью детерминированы. Система собирает отправленный дизайн,构建ует граф схемы и спецификацию материалов, запускает набор SPICE-симуляций и проверок проектирования. Каждое требование производит измерение с лимитом.

Для задачи со счётчиком энергии система измеряет защищённую шину пока входное питание отключается и возвращается. Другие задачи измеряют усиление, пороги, пульсацию, переходный отклик и поведение при экстремальных допусках компонентов. Технический балл объединяется с эффективностью затрат против опорного спецификации материалов. Стоимость помогает только после того, как схема работает.

Это похоже на предоставление кодирующему агенту компилятора и тестов, за исключением того, что тесты измеряют напряжения и поведение компонентов.

EEBench V1 охватывает аналоговое и цифровое проектирование через симуляции. Пока не говорит, может ли модель сделать размещение, производство и запуск полного продукта. Это нужно добавить позже. Текущий бенчмарк сосредоточен на цикле требования, проектирования и верификации, потому что именно там можно уже объективно оценивать полезную инженерную работу. Полная методология и исследователь примеров результатов общедоступны.

Что видно на таблице лидеров

Результаты от 1 сентября обнадёживают. Claude Opus 5 набрал 61,6% на 13 задачах EEBench V1. Grok 4.6 занял второе место с 57,1%, немного впереди Claude Fable 5.1 с 56,4%. Несколько месяцев назад не ожидали бы такие результаты от моделей.

1Claude Opus 561.6%
2Grok 4.657.1%
3Claude Fable 5.156.4%
4Claude Fable 554.3%
5Claude Opus 4.8 Max51.4%
Посмотреть полную таблицу лидеров и подробности запусков

Был ещё один результат, особенно приятный: xAI включила EEBench в карточку модели Grok 4.6. Она появляется в разделе "engineering acceleration" рядом с оценками 3D-моделирования и параметрического CAD. Их опубликованный запуск показал Grok 4.6 на 60,0% с максимальным усилием рассуждения. То, что лаборатория-лидер использует EEBench для описания способности новой модели к инженерии, говорит нам, что это становится категорией, которая людям важна.

Модели Anthropic последовательно хорошо показывают себя в этой среде. Рост Grok тоже интересен. В посте запуска Grok 4.6 xAI говорит, что модель получила высококачественные инженерные данные и обучение подкреплением в специализированных средах, включая компьютерное проектирование. Результат EEBench совпадает с этой историей.

Модели OpenAI, которые мы тестировали до сих пор, сидят ниже в таблице. GPT-5.5 набрал 42,3%, а GPT-5.6 Sol набрал 39,4%. GPT-6 Astra результата ещё нет. После того, как видели её работу над платой в KiCad, действительно хочется узнать, как она справляется с этими задачами проектирования схем.

Среда обучения

Когда была построена система симуляции, способная оценивать схему, началась и работа над RL-средой для электроники. Те же проверки можно использовать как сигналы вознаграждения во время постобучения.

Неудачный запуск содержит полезную информацию. Можно видеть, какое напряжение прошло лимит, какой угол работы отказал, или решила ли модель задачу с ненужно дорогостоящим дизайном. Это даёт обучающему циклу больше, чем просто модель, говорящая, что схема выглядит правдоподобно.

EEBench — маленькое, публичное представление этой работы. Начинается и прямая работа с лабораториями-лидерами, которые хотят улучшить навыки своих моделей в электронике. Если вы работаете над оценками или постобучением, можете поговорить с нами о более крупных наборах оценок и симуляционных средах обучения, которые мы предоставляем.

Итак, нейросети могут проектировать печатные платы?

Для полезного и растущего набора схемотехнических задач ответ уже да. Баллы также делают ясно, что многое ещё нужно сделать. OpenAI выбрала печатную плату для одной из первых демонстраций Astra, и xAI опубликовала EEBench на карточке модели — обе кажутся ранними признаками одного: лаборатории AI начинают электронику серьёзно.

Очень скоро может быть ещё одна точка данных. Илон Маск сказал, что Grok 4.7 выйдет в течение недель после дополнительного обучения на большом наборе данных SpaceX с целью сделать её особенно хорошей в инженерии. Модель ещё не вышла и расписание может двигаться, но если она появится так, как описано, с нетерпением поместим её на EEBench.

Похоже, нас ждут интересные недельки. Будут добавляться всё более сложные задачи по мере того, как улучшаются модели, и с нетерпением ждём, как справятся Astra и новое поколение.

Можно попробовать тот же подход в atopile прямо сейчас. Дайте агенту плату, которую вы давно собирались построить, и посмотрите, как далеко он продвинется.

Итак, могут ли нейросети проектировать печатные платы? Некоторые из них — да. Мы всё ещё не просили бы её спроектировать кардиостимулятор и слепо установить результат. Но мы уже на пути.

EEBench строится и финансируется командой, стоящей за atopile. Мы платим за запуски публичного бенчмарка и не продаём баллы бенчмарка.