DeepSeek представи най-новия си AI модел година след големия си пробив
Китайският стартъп представи серията V4 с обещания за мощна производителност с отворен код и драстично по-ниски разходи за внедряване.
Редактор: Волен Чилов
DeepSeek пусна предварителни версии на нов флагмански модел за изкуствен интелект година след като разтърси Силициевата долина. Компанията го определи като най-мощната платформа с отворен код, с което провокира конкуренти от OpenAI до Anthropic PBC.
Китайският стартъп представи сериите V4 Flash и V4 Pro, като изтъкна високата производителност в тестовете за програмиране и значителните подобрения в способността за разсъждение и изпълнението на задачи, свързани с агентно поведение. Те включват подобрения в архитектурата и оптимизации, съобщи стартъпът в Hugging Face.
DeepSeek се фокусира върху техника, която нарече Hybrid Attention Architecture, за която твърди, че подобрява способността на AI платформата да запомня запитвания в дълги разговори.
Тя също така разширява контекстния прозорец до 1 милион токена — скок, който позволява цели кодови бази или дълги документи да бъдат изпращани като един-единствен промпт.
V4 се появява повече от година, след като стартъпът от Ханджоу предизвика разпродажба на акции на стотици милиарди долари с пускането на R1 – модел с отворен код, който имитира процеса на човешкото разсъждение.
R1 се конкурираше с производителността на най-модерните AI системи от компании като OpenAI, но според твърденията беше създаден за част от цената.
Китайските производители на чипове отбелязаха ръст в петък, тъй като инвеститорите очакват новият модел да подкрепи търсенето на местни чипове. В публикация във WeChat DeepSeek заяви, че капацитетът на услугата за серията V4 Pro е изключително ограничен поради недостиг на изчислителна мощност.
Стартъпът обаче очаква цената на модела да спадне значително след пускането на пазара през втората половина на тази година на изчислителни клъстери, задвижвани от чипове Ascend 950 на Huawei Technologies Co. В момента DeepSeek води преговори с Tencent Holdings Ltd. и Alibaba Group Holding Ltd. за първия си кръг на финансиране.
Акциите на Semiconductor Manufacturing International Corp., основният производител на чипове за Huawei, отбелязаха ръст от 9,4% в Хонконг, докато Hua Hong Semiconductor Ltd. скочи с повече от 13%. Конкуренти като Knowledge Atlas Technology JSC Ltd. — или Zhipu — поевтиняха с 8%.
Новата серия е голяма крачка напред по отношение на мащаба и ефективността, които определят възхода на DeepSeek и оказват огромен натиск върху конкурентите. Вследствие на R1 технологичните компании и инвеститорите започнаха да преосмислят дали е разумно да се вливат милиарди долари в разработката на изкуствен интелект. Оттогава тези разходи отново се възстановиха.
Прогнозите са, че американските технологични гиганти ще инвестират около 650 милиарда долара през 2026 г. в инфраструктура за изкуствен интелект и центрове за данни.
Системата на DeepSeek с трилион параметри използва техниката „Mixture-of-Experts“, като избирателно задейства само малка подгрупа от експерти и активира до 37 милиарда параметри на задача, за да поддържа разходите за изводи значително по-ниски, отколкото при подобни авангардни модели.
Архитектурата и техниките позиционират DeepSeek в пряка конкуренция с най-новите модели на конкурентите от Силициевата долина OpenAI, Google и Anthropic. В петък стартъпът се похвали с по-добри резултати в сравнение с модели като GPT-5.2 на OpenAI при стандартните тестове, но призна, че V4 изостава от най-модерните модели с около 3 до 6 месеца.
Въпреки това DeepSeek подчерта, че не залага единствено на суровия капацитет, а и на фундаменталното намаляване на разходите. V4 е проектиран да се внедрява върху по-евтина инфраструктура.
„Minimax и Zhipu като независими доставчици на модели винаги ще бъдат уязвими към конкуренцията, особено от интернет платформи или доставчици на облачни услуги, които имат по-добър обхват и дистрибуция“, каза Вей-Сърн Лин, управляващ директор в Union Bancaire Privee. „В крайна сметка разликата в производителността на моделите ще бъде незабележима за повечето потребители.“
DeepSeek предизвика и истинска еуфория в Китай, а технологичните лидери – от Alibaba до Baidu Inc. – наводниха пазара с евтини услуги за изкуствен интелект. Конкуренти от ByteDance Ltd. до Zhipu и Minimax се втурнаха да актуализират своите модели в седмиците преди април, с надеждата да изпреварят DeepSeek.
Славата донесе и подозрения. Американски технологични лидери и правителствени служители обвиниха DeepSeek, че използва незаконни техники и хардуер за разработване на своите модели.
Един от акцентите е т.нар. дестилация, при която един AI модел разчита на резултатите от друг за целите на обучението, за да развие сходни способности. И OpenAI, и Anthropic твърдят, че са засекли подобни атаки от DeepSeek. OpenAI започна да изразява опасения по този повод непосредствено след пускането на модела R1.
Другото притеснение е, че DeepSeek може да има достъп до забранени AI чипове на Nvidia Corp., възможност, която американските власти започнаха да разследват миналата година.
Според запознати с въпроса, американското правителство счита, че китайският стартъп е използвал процесори Nvidia Blackwell, чиято продажба в Китай е фактически забранена, в център за данни в провинция Вътрешна Монголия.