Китай превзе AI видеото. Следващата битка е за физическия свят
Китайските компании вече доминират при моделите за генериране на видео, а предимството им може да се окаже ключово за следващия етап на изкуствения интелект
Редактор: Ивета Червенякова
Новите големи езикови модели като Kimi K3 на Moonshot доминират дебата за амбициите на Китай в областта на изкуствения интелект.
Най-ясното доказателство за технологичните възможности на страната обаче може да се крие именно във видеото, а залогът може да се простира отвъд простото разтърсване на Холивуд.
С изключение на Google на Alphabet Inc. почти всички водещи модели за генериране на видео са китайски, като девет от първите 10 системи за генериране на видео от текст в класацията на платформата за сравнителни тестове Artificial Analysis са разработени в Китай.
ByteDance Ltd. и MiniMax Group Inc. наскоро пуснаха последователно обновления на своите конкуриращи се модели за генериране на видео. Това последва изненадващата поява на „Happy Horse“ - тайна видеосистема, която разтърси индустрията, преди да стане ясно, че е проект на Alibaba Group Holding Ltd.
Към тях се присъединяват Kling на Kuaishou Technology, Vidu на базираната в Пекин ShengShu Technology, както и множество други стартъпи. Така Китай създаде необичайно голяма група от водещи компании в област, която американски лидери като OpenAI и Anthropic поставиха на по-заден план.
Китайските генератори на видео вече доминират сред водещите модели. Те заемат девет от първите 10 места сред моделите за генериране на видео от текст.
Тези инструменти все по-често се използват от рекламни агенции и развлекателни студиа, а дори подпомогнаха възхода на бързо разрастващата се индустрия на микродрамите в Китай и извън страната.
Някои ги разглеждат като реалистичен път към приходи в сектор, засегнат от ценови войни и несигурни бизнес модели. По-голямото им стратегическо значение обаче може тепърва да започва да се проявява.
Доминиращата позиция на Китай при генеративното видео може да му даде предимство в създаването на така наречените „световни модели“ - технология, отдавна определяна като следващото поколение изкуствен интелект.
Бизнес лидерите, подкрепени от все по-голям обем научни изследвания, смятат, че тези видеоинструменти в крайна сметка могат да се превърнат в основа за AI системи, които извеждат технологията отвъд екраните и във физическия свят.
Световните модели трябва да разбират повече от езика и да обхващат физиката, както и начина, по който обектите взаимодействат помежду си в несигурна реална среда. В крайна сметка тези системи могат да захранват хуманоидни роботи или автономни превозни средства.
Някои пионери в AI виждат това като по-жизнеспособен път към свещения граал на Силициевата долина - общ изкуствен интелект - в сравнение със създаването на все по-големи чатботове.
За да генерира убедително видео, един модел трябва да научи нещо повече от естетика. Той се нуждае поне от приблизително разбиране на движението, причинно-следствените връзки и физиката, иначе резултатите могат да бъдат комично абсурдни.
С разрастването на тези модели изследователите установяват, че елементарни способности за физическо разсъждение могат да се появят дори без изрично програмиране. Те все още не разбират света като нас, но стават значително по-добри в предвиждането как трябва да изглежда той и какво вероятно ще се случи след това.
Много изследователи вече комбинират тези видео модели с инструкции за обучение на роботи.
Няколко от водещите китайски компании за AI видео, сред които ShengShu, вече се насочват към пускането на „световни модели“ и по-широки мултимодални системи. Връзката не се прави само от китайски компании. Базираната в САЩ Runway AI и германската Black Forest Labs - два от най-известните западни стартъпа за визуален изкуствен интелект - следват същата траектория.
Главният изпълнителен директор на Runway Крис Валенсуела ми каза, че това е естествено развитие. За да бъде добър един видео модел, той трябва точно да симулира това, което бихме очаквали да се случи в реалния свят.
Например топката се търкаля през поле, вместо да се плъзга над него. Един робот не може да сгъва пране или да зарежда стоки в супермаркет само като разпознава какви са предметите. Той трябва да предвижда какво ще се случи, когато се движи или взаимодейства с тях.
Преходът от генериране на видео към обучение на "световни модели" все още е в ранен етап. Но след като OpenAI прекрати разработването на своя видео инструмент Sora, китайските разработчици се възползваха от момента и все по-често задават темпото.
Много предизвикателства обаче остават. Създаването на модели за видео, да не говорим за "световни модели", изисква значително повече данни и изчислителни ресурси. Авторските права са друга уязвимост за тези компании.
Това е проблем, с който цялата AI индустрия трябва да се справя, но при генераторите на видео се оказва по-трудно да се прикрие какво съдържа обучаващият набор от данни в сравнение с чатботовете. Това се превърна в сериозна пречка пред усилията на китайските платформи да се разширят на международните пазари.
Китай обаче вече е изградил значителни индустриални предимства в хардуера за роботика. Както съм писала и преди, стотици компании са успели да създадат хуманоидно тяло; това, което все още им липсва, е мозък. Все по-често данните и възможностите за симулация, разработени чрез моделите за генериране на видео, се използват за създаването му.
Световните модели може никога да не преживеят „момента на ChatGPT“. Стратегическото им значение едва ли ще бъде демонстрирано от масов потребителски инструмент, който милиони хора могат да изпробват сами.
Докато Вашингтон наблюдава китайските чатботове с нарастващо безпокойство, съществува риск вниманието да се съсредоточи върху най-видимото съперничество и да пренебрегне напредъка, който може да се окаже по-значим.
Компаниите и инвеститорите трябва да се вслушат в същото предупреждение. Големите езикови модели (LLM) продължаватда привличат по-голямата част от капитала, но следващият пробив може да дойде от системи, които могат да се ориентират във физическия свят, вместо само да го описват.
Ако видеото е тренировъчната среда за такива машини, ранните предимства на Китай няма да се ограничат само до това да разтърсят Холивуд. Те могат да определят кой ще води следващата ера на изкуствения интелект.
Катрин Торбек е колумнист на Bloomberg Opinion, пишещ за технологиите в Азия. Тя е бивш технологичен репортер в CNN и ABC News.