AMD довела перевагу Ryzen AI Max+ 395 над NVIDIA DGX

0
533 views
AMD довела перевагу Ryzen AI Max+ 395 над NVIDIA DGX

Компанія AMD опублікувала результати нового дослідження продуктивності платформи Ryzen AI Halo, заявивши, що в епоху автономних AI-агентів визначальним фактором стає не швидкість генерації токенів GPU, а швидкість завершення повного робочого процесу (workflow).

На відміну від традиційних чат-ботів, сучасні AI-агенти виконують багатоступеневі завдання — аналізують документи, виконують OCR, будують базу знань, здійснюють пошук, перевіряють результати та лише після цього генерують відповідь.

Саме тому AMD пропонує оцінювати продуктивність не за показниками Tokens per Second або Time to First Token, а за значно важливішими бізнес-показниками:

  • End-to-End Completion Time;
  • Cost per Completed Workflow;
  • швидкість виконання агентного циклу;
  • продуктивність локального inference.

AMD довела перевагу Ryzen AI Max+ 395 над NVIDIA DGX

Перехід від чат-ботів до Agentic Era

AMD оприлюднила розширені результати порівняльного тестування автономного виконання завдань (Local Agentic Workloads) на базі власного флагманського процесора Ryzen AI Max+ 395 (архітектура Strix Halo) та портативного прискорювача NVIDIA DGX Spark (Grace Blackwell GB10).
В епоху автономних ШІ-агентів підсумкові KPI зміщуються від швидкості видачі окремої відповіді чат-бота до загального часу виконання та перевірки складного бізнес-завдання.
За даними AMD, у реальних агентних сценаріях 7 із 8 етапів пакувального конвеєра (парсинг документів, OCR-розпізнавання, розбиття на чанки, генерація векторних ембеддінгів, пошук та верифікація) виконуються саме на CPU, і лише один етап — безпосередній синтез тексту — задействує GPU.

Результати бенчмарку HEPA

Для об’єктивної оцінки AMD розробила комплексний бенчмарк HEPA (Hermes Executive Presentation Agent). Агенту доручили сформувати аналітичну презентацію для ради директорів, супровідний меморандум та довідник джерел із локального масиву даних (302 файли / 801 чанк), що містив застарілі матеріали та скановані PDF з викликом Tesseract OCR.
Обидва стенди працювали під управлінням Linux з однаковою оркеструвальною моделлю Qwen3.6-35B-A3B (MoE, 4-bit) та FastEmbed ONNX на базі llama.cpp:
Метрика порівняння AMD Ryzen AI Max+ 395 (Halo) NVIDIA DGX Spark (GB10) Перевага AMD
CPU-оркестрація (Очищення/OCR/Ембеддінг) 152.1 сек 229.9 сек 🚀 На 34% швидше (71.5с проти 139.6с на ембеддінгах)
Загальний час виконання (End-to-End) 311.6 сек 367.1 сек ⏱️ На 15% швидше (випередження на 55.5 секунд)
Вартість одного завдання (3-річний CapEx) ~$0.0132 ~$0.0182 💰 На 27% дешевше за оброблений воркфлоу
Технічний успіх AMD пояснюється наявністю 16 ядер / 32 потоків “Zen 5” із векторизацією AVX-512/VNNI проти 20 ядер Arm (без SMT) у NVIDIA Grace Blackwell, а також архітектурою об’єднаної пам’яті LPDDR5X-8000.
                    ┌──────────────────────────────┐
                    │    HEPA AGENTIC BENCHMARK    │
                    │   (FULL WORKFLOW COMPLETION) │
                    └──────────────┬───────────────┘
                                   │
         ┌─────────────────────────┼─────────────────────────┐
         ▼                         ▼                         ▼
┌──────────────────┐      ┌──────────────────┐      ┌──────────────────┐
│ 7 з 8 етапів CPU │      │ Загальний час    │      │ Економіка CapEx  │
├──────────────────┤      ├──────────────────┤      ├──────────────────┤
│Парсинг / OCR /   │      │AMD: 311.6s       │      │-27% вартості на  │
│Ембеддінги / Пошук│      │DGX: 367.1s       │      │виконаний воркфлоу│
│AMD швидше на 34% │      │Заощаджено 55.5s  │      │Об'єднана RAM     │
└──────────────────┘      └──────────────────┘      └──────────────────┘

HiTech Expert Take

Дослідження AMD демонструє важливу зміну всієї індустрії генеративного ШІ. Якщо у 2023–2025 роках виробники змагалися переважно у швидкості генерації токенів GPU, то у 2026 році фокус зміщується на продуктивність комплексних агентних систем. Для корпоративних користувачів, які впроваджують локальні AI-рішення, критичними стають час виконання повного бізнес-процесу, захист даних і вартість одного завершеного завдання.

Особливо актуальним цей тренд виглядає на тлі стрімкого зростання інвестицій у AI-інфраструктуру. За прогнозом TrendForce, сукупні капітальні витрати дев’яти найбільших світових хмарних провайдерів у 2026 році перевищать 886 млрд доларів, що свідчить про безпрецедентний попит на AI-обчислення. Водночас дедалі більше компаній розглядають локальний inference як спосіб зменшити залежність від хмарних API, скоротити операційні витрати та підвищити рівень інформаційної безпеки.

Для України розвиток класу AI PC та локальних агентних систем відкриває перспективи використання генеративного ШІ у державному секторі, промисловості, фінансах, медицині та оборонних технологіях без необхідності передавати конфіденційні дані зовнішнім сервісам. У поєднанні з сучасною хмарною інфраструктурою, дата-центрами та високошвидкісними мережами такі рішення можуть стати важливим елементом цифрової трансформації бізнесу й GovTech.