NVIDIA опубликовала 45-страничный whitepaper, посвящённый Vera — первому серверному процессору компании, построенному вокруг собственного ядра Olympus. На бумаге Vera выглядит впечатляюще: монолитный вычислительный кристалл с 88 ядрами, Olympus — это 10-широкое ядро Arm v9.2 с предсказанием значений, графовым префетчером, 2 МБ приватного L2 на ядро, 164 МБ разделяемого кэша последнего уровня и восемью интерфейсами LPDDR5X, обещающими 1,2 ТБ/с пропускной способности.

Проблема в том, что значительную часть документа NVIDIA тратит на попытку превратить эти интересные инженерные решения в морализаторскую историю про x86. Традиционный SMT изображён как разделение времени, настраиваемая топология NUMA подана как неизбежный лабиринт из 32 узлов, четыре компонента SPEC превращаются в «агентные бенчмарки», неопределённые соотношения счётчиков производительности выдаются за причинно-следственное доказательство, а безымянная пиктограмма становится результатом обучения с подкреплением в 1,8 раза.

Досадно то, что Vera в этой помощи не нуждается: раннее независимое тестирование говорит о том, что Olympus — действительно серьёзное ядро. Самая сильная часть whitepaper — это железо; самая слабая — история, которой его обернули. Разберём эту историю по частям.

Olympus заслуживает лучшего маркетинга

Прежде чем браться за тёрку для сыра, стоит сказать о хорошем. Olympus — это очень широкое ядро с внеочередным исполнением на архитектуре Arm.

Фронтенд ядра декодирует до десяти инструкций за такт и обрабатывает до двух взятых переходов за такт. NVIDIA описывает нейросетевой предсказатель переходов, предсказание значений, переименование памяти, большое окно инструкций, шесть 128-битных SVE-конвейеров, четыре конвейера загрузки, два конвейера записи, 96 КБ кэша данных L1 и доступ к 2 МБ приватного L2 примерно за 10 тактов. Восемьдесят восемь таких ядер связаны фабрикой когерентности на 3,4 ТБ/с и распределённым системным кэшем на 164 МБ.

Если смотреть глубже, предсказание значений — одно из наиболее нетипичных добавлений в Olympus. Эта область исследуется давно: предсказание значений позволяет ядру, если оно правильно предугадало результат операции, продолжать выполнение зависимых инструкций вместо того, чтобы те простаивали в ожидании долгой операции. Исследователи обнаружили предсказание значений в ядрах Apple, а AMD рассказывала о том, что в Family 17h (Zen 1 и 2) могла предсказывать значения некоторых операций с плавающей точкой. Правда, реализация AMD в Family 17h была довольно ограниченной, тогда как у Olympus предсказание значений выглядит более широким и ближе к подходу Apple.

Графовый префетчер, однако, не является уникальным для NVIDIA. У Intel есть похожий механизм — Data-Dependent Prefetcher, присутствующий в выпускаемых чипах как минимум с 2022 года. В новейшем датацентровом процессоре Intel, Granite Rapids, также есть префетчер Array of Pointers, который «рассматривает данные, предзагруженные для нагрузки с постоянным шагом, как указатель, и может выдавать запросы предзагрузки по адресам, соответствующим значению этого указателя». По сути это та же идея «производитель-потребитель», которую NVIDIA описывает для своего графового префетчера. Реализация Intel довольно ограничена, поэтому реализация NVIDIA, возможно, способна обрабатывать более сложные цепочки. Так что графовый префетчер Vera может справляться с более широким спектром нагрузок, но сама идея префетчинга по схеме «производитель-потребитель» не нова.

Не нов и «нейросетевой предсказатель переходов». Ещё в 2012 году AMD реализовала перцептронный предсказатель переходов в микроархитектуре Piledriver и продолжила использовать перцептронный предсказатель в Zen 1. Однако начиная с Zen 2 AMD использовала перцептронный BPU только для начального предсказания направления, а TAGE-предсказатель переопределял его результат, поскольку это давало снижение числа промахов на 30%. В Zen 5 AMD, вероятно, полностью перешла на TAGE-предсказатели, если не сделала этого уже в Zen 3 или Zen 4.

Переходя к уровню SoC: раз ядро Olympus такое мощное, NVIDIA снабдила Vera соответствующей подсистемой памяти. Vera сочетает восемь модулей SOCAMM2 LPDDR5X с объёмом до 1,5 ТБ и пропускной способностью 1,2 ТБ/с. По заявлению NVIDIA, заполненная подсистема памяти потребляет всего около 50 Вт. Традиционные платформы EPYC или Xeon могут предложить DIMM большей ёмкости, которые проще заменить, но за эту гибкость приходится платить площадью платы и энергопотреблением.

Важнее всего, что есть не только результаты самой NVIDIA. В мае Michael Larabel из Phoronix протестировал раннюю систему на Vera против текущих серверов на Arm и x86. По набору тестов, разрешённых NVIDIA, среднегеометрическое Vera оказалось на 10% выше, чем у EPYC 9575F на 5 ГГц, в 1,55 раза выше Xeon 6980P и в 1,63 раза выше Grace — это делает Vera самым производительным серверным Arm-процессором, который встречался в публичных тестах. У тестирования есть серьёзные оговорки: NVIDIA сама выбирала разрешённый набор нагрузок и не позволяла мониторить частоту или энергопотребление. Система, которую тестировал Phoronix, была предпроизводственной, а окно тестирования составляло один день, что и без ограничений NVIDIA сильно сужало возможности тестирования. Это значит, что более широкая проверка возможна только когда Vera появится в реальных условиях, а не только в лабораториях NVIDIA.

Тем не менее результат достаточно убедителен, чтобы отвергнуть версию, будто графики в whitepaper NVIDIA — сплошная фантазия. Olympus, судя по всему, действительно быстрое ядро, и теперь можно спросить, доказывает ли whitepaper то, что заявляет NVIDIA.

Spatial Multithreading — это всё равно SMT

Вот первая крупная техническая ошибка документа.

Рисунок 5 противопоставляет «традиционный SMT (x86)» и «Spatial Multithreading» от NVIDIA. Сторона x86 изображает стадии предсказания переходов, декодирования, исполнения, обращения к памяти и загрузки/сохранения, чередующиеся между двумя потоками. В подписи говорится, что Vera избегает «оппортунистического разделения времени», разбивая ресурсы между двумя аппаратными потоками.

Диаграмма NVIDIA создаёт ложное впечатление о том, как обычно реализован SMT — как в x86-64, так и в других архитектурах. Реализации SMT разделяют различные стадии конвейера исполнения либо выбирая поток для обслуживания каждый такт, либо ведя себя нейтрально по отношению к потокам. Стадии выборки, декодирования и распределения обычно обслуживают потоки поочерёдно каждый такт, тогда как стадии исполнения и обращения к памяти нейтральны к потокам и могут обслуживать микрооперации сразу от обоих потоков в один такт. На стадиях, за которые потоки конкурируют, ресурсы не остаются незанятыми, если оба потока могут быть обеспечены работой — в отличие от того, что предполагает диаграмма NVIDIA. Статическое разделение и поочерёдный выбор потока за такт дают одинаковую среднюю пропускную способность обоим потокам при отсутствии простоев у каждого из них. Если простои случаются, поочерёдный выбор может отдать иначе неиспользуемую пропускную способность потоку, который не простаивает.

Гипотетический пример активности стадии декодирования для процессора, статически разделяющего декодирование для SMT, и 8-широкого процессора, где декодирование выбирает поток для обслуживания каждый такт. Поочерёдный выбор потока за такт эффективно скрывает простои в одном потоке, тогда как статическое разделение оставляет пропускную способность неиспользованной

Та же логика применима к нейтральным по отношению к потокам стадиям — исполнению и обращению к кэшу. Каждому потоку разрешено использовать столько исполнительных устройств или портов кэша, сколько он способен занять работой. Напротив, статическое разделение ресурсов, как предполагает NVIDIA, может привести к тому, что один поток окажется вычислительно ограничен и не сможет использовать половину исполнительных ресурсов ядра, поскольку они зарезервированы за другим потоком.

Рисунок из статьи Intel про SMT в Pentium 4, показывающий, как стадия исполнения может обслуживать оба потока в один и тот же такт.

Текст в документе NVIDIA делает упор на «детерминизм, изоляцию и качество обслуживания» как на преимущества подхода Spatial Multithreading. О производительности при этом заметно не упоминается. QoS может быть для целевого рынка NVIDIA более важным фактором, чем пропускная способность, и Spatial Multithreading вовсе не обязательно плохое инженерное решение. Но рисунок NVIDIA выглядит так, будто вертикальное пространство представляет время, и создаёт ложное впечатление, что Spatial Multithreading задуман давать больший прирост производительности, чем традиционный SMT.

Снижая конкуренцию за ресурсы между потоками, Spatial Multithreading повышает детерминизм, изоляцию и качество обслуживания по сравнению с традиционными подходами SMT. Результат — архитектура CPU, способная выполнять большое число одновременных агентных задач, сохраняя более стабильную латентность и пропускную способность. — whitepaper NVIDIA Vera

Реальная производительность SMT у Vera неизвестна, разумеется, и на прирост от SMT влияет множество переменных помимо стратегий разделения на стадиях выборки, декодирования, исполнения и обращения к памяти. Ресурсы внеочередного исполнения — буфер переупорядочивания, регистровые файлы, очереди упорядочивания памяти — могут дублироваться, статически разделяться, работать по принципу водяных знаков или конкурентно совместно использоваться. Разделённые структуры распределялись между двумя логическими процессорами в многопоточном режиме и объединялись для одного потока в однопоточном режиме — это было описано ещё в 2002 году. Разные реализации SMT используют разные стратегии для каждой структуры, и эти решения существенно влияют на итоговый прирост от SMT.

Таблица из руководства по оптимизации AMD Zen 5, показывающая разные стратегии разделения различных ресурсов ядра

Стоит также отметить, что, судя по всему, ядру Olympus требуется 10 000 тактов, чтобы вернуться в однопоточный режим после завершения работы соседнего потока на этом же ядре. Это означает, что программному обеспечению придётся очень осторожно подходить к запуску второго потока на ядре Olympus — из-за штрафов не только от самой схемы разделения ресурсов, но и от задержки при переключении обратно в однопоточный режим.

Будет интересно увидеть, какую стратегию Vera использует для разделения ресурсов внеочередного исполнения и как её производительность SMT сравнится с другими современными ядрами. Whitepaper NVIDIA не даёт по этому поводу никакой информации. Что он действительно делает — это представляет вводящую в заблуждение диаграмму, намекающую, что традиционный SMT склонен оставлять ресурсы незанятыми, тогда как на практике он может лучше держать ядро загруженным работой, чем Spatial Multithreading от NVIDIA.

Соломенное чучело в виде 32 узлов NUMA

Далее NVIDIA заявляет, что крупная двухсокетная система x86 может выставлять «до 32 доменов NUMA», в то время как Vera представляет по одному на сокет. Цифра не выдумана. На чиплетной системе EPYC с большим числом чиплетов администратор может выставить кэш-локальные регионы как отдельные узлы NUMA. Если довести все настройки локальности до максимальной гранулярности, число узлов действительно вырастет.

Что NVIDIA упускает — это то, что данная настройка конфигурируется: в руководстве AMD по настройке перечислены режимы NPS4, NPS2, NPS1 и даже NPS0. Опциональная настройка «LLC как NUMA» может выставлять каждый домен кэша последнего уровня отдельно. Так что «32 узла NUMA» — это не неизбежный пользовательский опыт чиплетного процессора, а один из концов спектра управления локальностью. NVIDIA представляет опциональную конфигурацию высокой гранулярности как будто это неизбежная реальность систем x86.

Один домен на сокет у Vera упрощает планирование и размещение памяти, тогда как множество доменов позволяет настроенному программному обеспечению использовать физическую локальность. Vera выбирает более простое представление, и NVIDIA вправе утверждать, что это лучше соответствует её целевому программному стеку. Но видимый ОС узел NUMA — это абстракция, а не кротовая нора. У Vera по-прежнему 88 ядер, распределённый кэш и домашние узлы, контроллеры памяти вокруг большого кристалла и коммутируемая пакетная фабрика когерентности. Плоская программная топология может сделать расстояния вокруг большого монолитного вычислительного кристалла более стабильными, но не может сделать их несуществующими.

Тепловые карты «ядро-ядро» из документа были бы хорошим местом, чтобы количественно оценить это преимущество. Вместо этого NVIDIA даёт цветные квадраты без идентификаторов ядер, без таблицы минимум/медиана/максимум, без распределения и без описания методики измерения. «До 50% ниже» отражает лучший результат NVIDIA, а не типичное поведение Vera.

Один узел NUMA на сокет действительно проще, но whitepaper сравнивает его с опциональной конфигурацией x86 из 32 доменов, представляя этот крайний случай как базовый уровень. Контраргумент здесь в том, что у Intel есть Mesh NoC, точно такая же, как у Vera. Реальная разница между этими двумя схемами в том, что кластерная схема EPYC даёт высокую латентность между кластерами, но низкую внутри кластера, тогда как у Vera и mesh-схемы Xeon латентность равномерно средняя; разные конфигурации — это просто разные инженерные компромиссы.

SPEC под видом «агентного ИИ»

Раздел бенчмарков — это то место, где whitepaper, вроде бы посвящённый процессору, начинает надевать бейдж AI-конференции, найденный на полу.

NVIDIA выбирает четыре целочисленных теста из SPEC CPU 2026 — CPython, GCC, LLVM и Cppcheck — и называет их «агентными бенчмарками». Сам SPEC описывает их как интерпретатор Python, два оптимизирующих компилятора и статический анализатор C/C++. Это полноценные программы для нагрузки CPU. Они нагружают большие объёмы инструкций, код с обилием переходов, выделение памяти и цепочки зависимостей. Агенты действительно могут вызывать подобные программы.

Но сами они не агенты: никакая модель не отдаёт токены, никакой агентный runtime не выбирает инструменты. Никакая песочница не запускается, не блокируется на I/O, не извлекает контекст, не оценивает ответ и не передаёт наблюдения обратно в политику. Эти нагрузки могут быть полезными приближениями для кодоёмких частей агентного конвейера. Но называть их «агентными бенчмарками» превращает частичное перекрытие в утверждение, будто они представляют полный сквозной рабочий процесс.

В документе результаты SPEC корректно обозначены как оценочные, поскольку референсное оборудование Vera на момент теста было недоступно широкой публике. Рисунок 15 показывает преимущество в 1,7–1,8 раза для четырёх выбранных компонентов, нормализованное на физическое ядро в полностью загруженной двухсокетной системе. Если открыть страницы конфигурации, полные оценочные суммарные показатели SPECrate 2026 Integer Base составляют 925 для двух сокетов Vera и 898 для двух сокетов EPYC 9755 — то есть преимущество по суммарной пропускной способности системы всего 3,0%.

Оба числа могут быть верны одновременно. Vera использует 176 физических ядер на два сокета, тогда как система EPYC — 256. Если разделить каждый результат на количество физических ядер, Vera оказывается примерно на 50% быстрее на ядро по всему набору целочисленных тестов, а выбранные тесты достигают разницы 70–80%.

Есть ещё одна коллизия терминологии. NVIDIA называет рисунок 19 «однопоточным IPC», описывая при этом полностью загруженную систему.

Опубликованная конфигурация запускает 352 копии на 176 ядрах Vera и 512 копий на 256 ядрах EPYC — по две копии на физическое ядро. Возможно, NVIDIA замеряла один логический поток, пока соседний был активен, возможно, суммировала счётчики и делила — документ не объясняет. Результаты SPEC полезны, и производительность Vera на ядро действительно высока. Тем не менее, преподнося эти тесты как агентные нагрузки и делая упор на нормализованные показатели, whitepaper создаёт впечатление более широкого преимущества, чем позволяют опубликованные данные.

IPC без инструкций

NVIDIA объясняет заявленное лидерство Olympus по IPC четырьмя группами счётчиков. В зависимости от выбранной нагрузки Vera якобы достигает до 2,3 раза больше предсказаний переходов за такт, 3,5 раза больше взятых переходов за такт, 2,4 раза больше операций выборки инструкций за такт и 4,3 раза больше бэкенд-операций за такт.

Звучит технически конкретно, но проверить это невозможно без названий и определений событий PMU, необработанных значений счётчиков, интервалов выборки, тактовых частот и так далее. Не говоря уже о том, что инструкция Arm — это не та же единица работы, что инструкция x86. Внутренняя бэкенд-операция ещё менее переносима: одна микроархитектура может разбивать инструкцию на несколько микрооперaций, а другая — оставлять её слитой.

Межархитектурный IPC всё же может быть информативным в сочетании с числом завершённых операций, тактовой частотой и анализом кода. Сам по себе он не может служить метрикой производительности. Два бинарника могут выполнять одну и ту же задачу за одно и то же время, отчитываясь при этом о совершенно разных значениях IPC. Один может просто завершать больше инструкций, каждая из которых делает меньше работы, — а затем нужно ещё учесть тактовую частоту, которая может кардинально различаться. IPC описывает поведение ядра при выполнении конкретного кода, а не универсальную меру полезной работы.

Если смотреть на результаты предсказателя переходов, большее число предсказаний за такт может говорить о мощном предсказателе, а может — о том, что бинарник для Arm содержит больше переходов, что бенчмарк проходит код быстрее, или что событие NVIDIA учитывает спекулятивные предсказания, которые событие EPYC не учитывает. Большее число бэкенд-операций за такт может коррелировать с производительностью, ничего не говоря о том, какая именно особенность её вызвала. Чтобы изолировать вклад предсказания значений, графового префетчинга или нейросетевого предсказателя, нужны эксперименты с включением/выключением функций или хотя бы определения событий и данные о снижении промахов. Преимущество Vera над Turin по IPC может быть реальным, но графики в whitepaper NVIDIA не дают достаточной детализации, чтобы это показать.

Преимущество Vera по памяти реально, но неправильно объяснено

Раздел о памяти содержит самый сильный результат NVIDIA и один из самых слабых выводов.

Против двухсокетной системы EPYC 9755 в документе Vera достигает примерно 1,1 ТБ/с на графике латентности под нагрузкой, тогда как Turin выходит на плато около 400 ГБ/с. Vera также показывает 12,7 ГБ/с на ядро против 3,1 ГБ/с на ядро у Turin. Эти результаты не совпадают с собственными тестами Turin.

При тестировании Turin удалось получить примерно 570 ГБ/с с 12-канальной подсистемой памяти DDR5-6400. Это напрямую противоречит результатам NVIDIA, которые выходят на плато на уровне ~400 ГБ/с пропускной способности памяти. Это также ставит под вопрос цифры пропускной способности на ядро: при пересчёте показатель для EPYC 9755 вырастает до ~4,5 ГБ/с на ядро.

Vera всё равно оказывается впереди, но результат по Turin существенно меняет масштаб этого преимущества. Сравнивая примерно 1,1 ТБ/с у Vera с измеренными 570 ГБ/с, получаем преимущество NVIDIA по пропускной способности в 1,9 раза, а не почти в 3 раза, как показано в whitepaper. Пересмотр показателя на ядро для EPYC 9755 с 3,1 ГБ/с до примерно 4,5 ГБ/с аналогичным образом снижает преимущество Vera с 4,1x до примерно 2,8x. А если посмотреть на модель, которую AMD фактически продвигает как SKU для AI-узлов — EPYC 9575F, — то показатель на ядро становится 12,7 ГБ/с против ~9 ГБ/с у 9575F, что даёт улучшение около 40% в пользу Vera. Это всё ещё хорошие цифры для Vera, но история получается заметно менее драматичной.

Если смотреть на теоретические показатели, AMD указывает предел Turin в 614 ГБ/с от 12 каналов DDR5-6400. Полученный результат 570 ГБ/с достигает примерно 93% этого теоретического предела. Восемь интерфейсов LPDDR5X-9600 у Vera обеспечивают 1,2 ТБ/с, а измеренные NVIDIA 1,1 ТБ/с достигают примерно 92% этой цифры. Иными словами, оба процессора преобразуют в устойчивую пропускную способность на удивление схожую долю своего теоретического предела. Vera выигрывает потому, что имеет примерно вдвое больше пиковой пропускной способности одного сокета Turin и меньше ядер, конкурирующих за неё, а не потому, что Turin особенно плохо использует доступную пропускную способность памяти.

Несмотря на это, whitepaper неоднократно приписывает достижение монолитному вычислительному кристаллу Vera, противопоставляя его «традиционным чиплетным CPU». Монолитный кристалл действительно может снижать путь по фабрике и улучшать латентность под нагрузкой, но результат по Turin напрямую подрывает это объяснение разницы в пропускной способности. Чиплетный EPYC 9755, достигающий примерно 93% своего теоретического предела, в данном случае явно не сдерживается своей чиплетной топологией. Основная часть преимущества Vera по пропускной способности объясняется именно интерфейсами памяти, подключёнными к процессору.

Сравнение к тому же почти сразу устарело. NVIDIA опубликовала технический блог и whitepaper 21 июля, а спустя два дня AMD выпустила 6-е поколение EPYC. 96-ядерный EPYC 9686F, который гораздо ближе к 88 ядрам Vera по количеству, предлагает 16 каналов памяти с поддержкой DDR5-8000 или MRDIMM-12800, что даёт 1024 или 1638 ГБ/с на сокет — при максимальной скорости MRDIMM Venice получает больше теоретической пропускной способности, чем Vera, как в сумме, так и на ядро, в зависимости от рассматриваемой модели.

То, что демонстрируют новые спецификации EPYC и собственные тесты Turin, гораздо уже, чем заявление NVIDIA о «трёхкратном превышении пропускной способности памяти по сравнению с новейшим x86 CPU»: это заявление зависит от результата по Turin, который не отражает пропускную способность, реально доступную для этого же поколения процессоров. Против собственного результата Vera обеспечивает примерно 1,9x суммарной пропускной способности и 2,8x на ядро — это всё ещё впечатляющий результат платформы, но не доказательство преимущества монолитных Arm-процессоров над чиплетными x86 в части пропускной способности памяти.

Графики PageRank и RL нуждаются в данных

NVIDIA заявляет преимущество в 2,6 раза по PageRank над EPYC 9755 и показывает, что Vera масштабируется почти линейно до 32 ядер, тогда как EPYC выходит на плато с приростом всего в 10 раз при 32 ядрах. NVIDIA объясняет это улучшение по сравнению с Turin монолитным вычислительным кристаллом с высокопропускной Scalable Coherent Fabric, пропускной способностью памяти 1,2 ТБ/с у Vera и графовым префетчером внутри ядра Olympus.

Однако, хотя документ и ссылается на GAP Benchmark Suite, он не приводит переменные, которые NVIDIA использовала, а они важны для того, как проходит этот тест. График масштабирования обрывается на 32 ядрах, хотя у машин по 88 и 128 ядер на сокет. Результат в 2,6 раза интересен, но без указанных переменных его, скорее всего, невозможно воспроизвести.

Для теста с ClickHouse NVIDIA ссылается прямо на результат Phoronix, где Vera лидировала среди протестированных процессоров по трём проходам на наборе данных из 100 миллионов строк. График в whitepaper с преимуществом в 1,2 раза всё равно избирателен, так как не использует результаты 9575F, но сам базовый результат был получен сторонним тестировщиком на узнаваемой нагрузке.

А затем идёт рисунок 24: «Vera даёт 1,8x для обучения с подкреплением», с рядом маленьких квадратиков «завершённых задач». Нет ни модели, ни среды, ни распределения нагрузки между CPU/GPU, ни фреймворка, ни размера батча, ни замера энергопотребления, ни числа повторов, ни погрешности. Неизвестно даже, представляют ли квадратики выборки, шаги или просто случайное расположение плиток в штаб-квартире NVIDIA.

Это не плохой бенчмарк — это вообще не бенчмарк.

Окружающий текст объясняет, почему более быстрый CPU может улучшать rollout-фазы обучения с подкреплением за счёт более быстрых шагов среды и расчёта наград, что позволяет быстрее подавать данные ускорителям, — однако рисунок 24 даже не претендует на то, чтобы это измерять.

Хорошему процессору не нужен плохой аргумент

После 45 страниц отношение к Vera оказывается заметно более положительным, чем отношение к whitepaper о Vera.

Olympus выглядит серьёзным ядром: 10-широкий декодер с фиксированной длиной инструкций, большие приватные кэши, предсказание значений, агрессивная обработка переходов, префетчинг с учётом графа зависимостей и монолитный 88-ядерный кристалл — все эти решения указывают на процессорное ядро с очень высокой производительностью. Подсистема памяти тоже не подкачала: LPDDR5X-подсистема с пропускной способностью до 1,2 ТБ/с придётся по вкусу серверным нагрузкам, требовательным к памяти, а ранние независимые бенчмарки говорят, что кремний способен отработать хотя бы часть обещаний whitepaper.

Однако конкурентная аргументация документа заметно слабее: она искажает суть SMT в x86, превращает опциональную конфигурацию NUMA в обязательную нагрузку по умолчанию, переименовывает стандартные тесты CPU в агентные нагрузки, скрывает 3-процентное преимущество по суммарной производительности двухсокетной системы за столбиками с приростом 1,8x на ядро, сравнивает неопределённые межархитектурные счётчики, приписывает победу по интерфейсу памяти достоинствам монолитности и подаёт иллюстрацию как данные о производительности.

Ничто из этого не делает Vera медленным процессором — это просто делает доказательную базу NVIDIA скромнее, чем прозу маркетинга NVIDIA.

Следующий раунд тестирования Vera должен быть простым: дать независимым обзорщикам неограниченный доступ к серийному оборудованию, чтобы можно было опубликовать данные по частоте, энергопотреблению пакета и по сети, протестировать Spatial Multithreading во включённом и выключенном состоянии и, конечно, прогнать любые бенчмарки и нагрузки по собственному выбору. Если Vera действительно так хороша, как предполагает архитектура, такие тесты будут гораздо убедительнее, чем изображение SMT в x86 в виде крошечного двухполосного светофора. При текущем положении дел маркетинг NVIDIA рискует подпортить репутацию Vera. Процессор уже получился достаточно хорошим, чтобы перестать одалживать убедительность у маркетингового конвейера.