Xpeng AI: новий VLA навчить моделі розуміти час

Компанія Xpeng активно розвиває технології штучного інтелекту для своїх автомобілів, і нещодавній захід, присвячений фізичному ШІ та новій версії VLA, став ключовою подією. Лю Сяньмін, керівник відділу загального інтелекту Xpeng Group, поділився важливими аспектами розвитку їхньої системи.

Фізичний ШІ: розуміння світу та дія в реальності

За словами Лю Сяньміна, головне завдання фізичного ШІ полягає в тому, щоб система могла повноцінно розуміти світ і діяти в ньому, попри всі обмеження реального середовища. Він зазначив, що півроку тому Xpeng сформулювала формулу можливостей фізичного ШІ: Здібності = Модель × Обчислювальна потужність × Дані × Тіло (агент).

  • Модель визначає потенційну межу інтелекту.
  • Дані надають досвід взаємодії зі світом.
  • Обчислювальна потужність підтримує тренування та роботу системи.
  • Тіло (агент) дозволяє ШІ реально застосовувати свої можливості у фізичному світі.

Революція в розумінні часу: від 3D до 4D

Ключовою проблемою для ШІ є розуміння світу як безперервного процесу, а не просто статичних зображень. Для цього модель повинна навчитися розуміти, що таке час. Саме на це спрямовані оновлення другої версії VLA.

«Друга генерація VLA оновлена ​​з фокусом на те, щоб моделі вперше почали формувати розуміння часового виміру», — підкреслив Лю Сяньмін.

Базова модель фізичного світу Xpeng тепер включає «час» як один зі своїх параметрів. Це дозволяє ШІ переходити від розуміння світу в 3D-просторі до сприйняття 4D-просторо-часу. Це означає, що чим довший час спостереження та чим більше накопичено інформації, тим швидше модель повинна реагувати, частіше приймати рішення та забезпечувати вищий рівень безпеки. Водночас, чим більша модель, тим ширшою стає її здатність до узагальнення, що, у свою чергу, підвищує вимоги до обчислювальних ресурсів.

Infini-VLA: запам’ятовуючи 30 секунд минулого

Раніше моделі ШІ переважно спиралися на інформацію, актуальну «тут і зараз». Нова версія VLA, завдяки архітектурі Infini-VLA, здатна запам’ятовувати стан світу протягом останніх 30 секунд. Це суттєво розширює контекст для прийняття рішень під час керування автомобілем, дозволяючи моделі враховувати більше корисної інформації.

Прискорення реакції: від «бачу» до «дію» за частки секунди

Дорожня ситуація постійно змінюється, тому критично важливо, щоб система прийняття рішень встигала за цими змінами. Якщо швидкість реакції моделі відстає від реальності, вона не може забезпечити надійний інтелект для управління автомобілем у фізичному світі.

Друга версія VLA також значно покращує ефективність роботи моделі. Завдяки використанню потокового авторегресивного виводу (stream autoregressive inference), час відгуку системи скоротився на 300%. Це реалізує паралельну обробку, дозволяючи системі одночасно «бачити, думати та діяти».

Таким чином, оновлення VLA від Xpeng робить значний крок уперед у створенні більш інтелектуальних та безпечних систем для автономного водіння, надаючи штучному інтелекту можливість розуміти складність реального світу.

Джерело: https://www.ithome.com/0/995/014.htm