DeepSeek (тел моделе)
DeepSeek — шундай уҡ атамалы Ҡытай яһалма аҡыл лабораторияһында эшләнгән асыҡ программа тәьминәтле тел моделе ғаиләһе. Ҙур тел моделдәренең чат-ботлы яңы версиялары — DeepSeek-V3 һәм «уйлаусы» DeepSeek-R1 логик мәсьәләләрҙе сисеү өсөн — тәбиғи телдәрҙе, математик мәсьәләләрҙе эшкәртеүҙә һәм программалауҙа көнәркәштәре эшләгән өлгөләр (|GPT-4о йәки Open AI-o1, шулай уҡ Көнбайыш компанияларының шундай уҡ моделдәре) менән сағыштырғанда тиң йәки яҡшыраҡ һөҙөмтәләр күрһәтә[1][2][3][4].
Шул уҡ ваҡытта, DeepSeek раҫлауынса, уларҙың моделдәре өйрәнеү һәм эште алып барыу өсөн күпкә кәмерәк ресурс талап итә, шулай уҡ Рәсәй һәм донъяның башҡа илдәренән ҡулланыусыларға инеүҙе сикләмәй[2][5]. Бынан тыш, моделде ҡулланыу хаҡы Көнбайыш көнәркәштәр менән сағыштырғанда уртаса 96 процентҡа түбән[6][7].
DeepSeek-R1 моделенең 2025 йылдың 20 ғинуарында баҙарға сығыуы АҠШ технология компанияларының (яһалма аҡыл өлкәһендә эшләгәндәренең дә, иҫәпләү ҡорамалдары сығарғандарҙың да) баҙар котировкаларын ҡапыл төшөрә, шулай уҡ Көнбайыш ЯА инфраструктураһына күп миллиардтар һалыныу, ҡорамалға юғары талаптар һәм уның хаҡы буйынса нигеҙле бәхәстәр тыуҙыра[8][9].
Үҫеш тарихы
DeepSeek 2015 йылда Ҡытай миллиардеры һәм яһалма аҡыл өлкәһе энтузиасы Ляном Вэньфан нигеҙләгән High-Flyer Ҡытай хедж-фондының яһалма аҡыл йүнәлешенән айырым стартап итеп айырыла. 2024 йылдың июлендә ул заманса генератив моделдәрҙең сикләнгәнлеге тураһында белдерә, ә яңы компанияның бурысы итеп дөйөм яһалма аҡылға (AGI) өлгәшеүен билдәләй[10]. 2024 йылдың ноябрендә компания башлығы тағы бер тапҡыр асыҡ программа тәьминәтле продукция булдырыу һәм DeepSeek-тың түләүле хеҙмәттәрен артабан киңәйтеү буйынса пландарының булмауы идеяһына тоғролоғон тағы бер тапҡыр раҫлай[11].
DeepSeek продукцияһын таратыу шарттары
Яһалма аҡыл өлкәһендә Көнбайыштың алдынғы компанияларынан (OpenAI, Meta йәки Anthropic) айырмалы, DeepSeek-тың барлыҡ тел моделдәре баштан уҡ ирекле MIT лицензияһы менән таратыла. DeepSeek V3 һәм DeepSeek R-1 уңышына фекерен белдереп, 2025 йылдың ғинуарында Metaның яһалма аҡыл буйынса баш белгесе Ян Лекун: «Яһалма аҡыл өлкәһендә асыҡ программа тәьминәтле моделдәр үҙҙәренең өҫтөнлөгөн раҫланы», — ти[12].
Релиздар
2023 йылдың ноябренән DeepSeek ҙур тел моделдәренең 3 быуынын тәҡдим итә.
DeepSeek Coder һәм DeepSeek LLM
DeepSeek-тан беренсе Coder нейроселтәре 2023 йылдың 2 ноябрендә тәҡдим ителә; шул уҡ айҙың 29-ында 67 млрд параметрлы, ул ваҡытта Llama 2 мөмкинлектәрен үтеп киткән һәм GPT-4-кә яҡынлашҡан беренсе универсаль ҙур тел моделе DeepSeek LLM сыға[13], әммә, ҡайһы бер мәғлүмәттәр буйынса, таралыуы һәм иҫәпләү һөҙөмтәһе менән проблемалар була[13]. Шул ваҡытта беренсе тапҡыр DeepSeek LLM нигеҙендә эшләгән интеллектуаль чат-бот тәҡдим ителә.
Беренсе моделдең барлығы 8: дүрт алдан өйрәтелгән стандарт (Base) һәм дүрт инструкциялар тупланмаһы менән нескә көйләү үткән (Instruct) варианты эшләнә. Улар барыһы ла Llama моделдәре ҡулланған «иғтибар» механизмлы трансформер архитектураһына нигеҙләнә.
- 1,8 триллион токенға алдан өйрәтеү үткәрелә (мәғлүмәттәр тураһында фәндә 1 миллион токен яҡынса 750 һүҙгә тиң)[14].
- Long-context pretraining (LCP — оҙон эҙмә-эҙлекле контекстар менән эшләргә өйрәтеү) база моделдәре 200 миллиард токен өйрәнә, был иһә селтәр эшкәрткән контекстың иң ҙур оҙонлоғон 4 мең токендан 16 меңгә тиклем үҫтереү мөмкинлеген бирә.
- Моделдәрҙе Instruct нескә көйләү 2 миллиард токен күләмендәге инструкциялар тупланмаһы нигеҙендә үтә[15].
DeepSeek-V2
2024 йылдың майында DeepSeek тел моделенең икенсе версияһын дүрт варианттар сығара: стандарт (V2), бәләкәйләтелгән (V2-Lite), шулай уҡ бәләкәйләтелгән чат-бот (V2-Chat) һәм уның бәләкәйләтелгән версияһы (V2-Chat-Lite).
Өлкән моделдәрҙә параметрҙар күләме 236 миллиардға тиклем арта; алдан 8,1 триллион токен өйрәтелә, ә контекстың иң ҙур күләме 128 мең токенға етә.
Модель беренсе версия менән сағыштырғанда һиҙелерлек үҙгәрештәр кисерә: унда Multi-head Learning Attention (MLA, «күп иғтибарлы өйрәтеү») түбән ранглы аппроксимация нигеҙендә машина өйрәтеүенең инновацион ысулы ҡулланыла[16]. Ул моделдең өйрәнеүенең хаҡын һәм ваҡытын күп тапҡырға кәметә[16][17]. Бынан тыш компания Mixture of Experts (MoE, — «эксперттар ҡатнашмаһы») моделенә эшләп бөтөү принцибын әҙерләп индерә: бындай ҡараш булғанда моделдең өҫтәмә селтәрҙәре арта, уларҙың һәр ҡайһыһы үҙенең махсуслашҡан өлкәһе буйынса ғына яуап бирә һәм яуап эҙләүгә ихтыяж тыуғанда ғына ҡушыла[18][19].
MLA менән MoE комбинацияһы миллион токенды эшкәртеү хаҡын 2 юань тип ҡуйыу мөмкинлеген бирһә, ChatGPT-ҙа ул шундай уҡ мәғлүмәт күләме өсөн 2,5 доллар тора[20]. Шул уҡ ваҡытта DeepSeek-V2 эш һөҙөмтәһенең сифатлы булыуын да күрһәтә: Ватерлоо университеты ҡарамағындағы яһалма аҡыл лабораторияһы иң яҡшы тел моделдәре рейтингында уны 7-се урынға ҡуя[21].
DeepSeek-V3
2024 йылдың декабрендә ирекле ҡулланыуға моделдең өсөнсө быуынының ике варианты сығах: стандарт (V3-Base) һәм 671 миллиард параметрға, 14,8 триллион токенға эйә чат-бот (V3). DeepSeek-V2 архитектураһында эшләнгән һәм тикшерелгән нейсоселтәр OpenAI, Meta йәки Anthropic компанияларының алдынғы моделдәре менән бер рәттән текстарҙы анализлай, мөһим урындарҙы ғына билдәләп, һөйләп бирә, тәржемә эшләй, шулай уҡ математик мәсьәләләр эшләй һәм программалар яҙа ала[2]: DeepSeek-V3 Llama 3.1 Qwen 2.5 тестарында алда бара[1] һәм GPT-4о, Claude 3.5 Sonnet кимәленә тап килә[2][3].
Тәҡдим ителгән DeepSeek бушлай ҡушымтаһы — «DeepSeek — AI Assistant» чат-боты — 2025 йылдың ғинуар һуңына донъяла иң күп күсереп алынған ҡушымта була, АҠШ-тың иң юғары баһаланған бушлай ҡушымталары рейтингында ChatGPT-ҙы үтеп китә[22]. Бынан тыш DeepSeek санкциялар сәйәсәтен хупламай һәм модел менән ҡулланыу мөмкинлектәрен сикләмәй — донъяның барлыҡ илдәре, шул иҫәптән Рәсәй ҡулланыусыларына ла бер тигеҙ мөмкинлек бирелә[2].
Шул уҡ ваҡытта, моделде эшләүселәр раҫлауынса, уны өйртәеүгә ни бары 55 көн, шулай итеп өйрәтеү сығымдары ни бары 5,5 миллион доллар китә: Llama йәки GPT-4o ҡарағанда күпкә кәмерәк[7][23].
Моделдең үҙенсәлектәре
DeepSeek архитектураһының үҙенсәлектәре арҡаһында һөҙөмтәлелектең түбәндәге күрһәткестәренә өлгәшеү мөмкин була:
- Бер үк ваҡытта һөйләмде һүҙ төркөмдәре буйынса анализлаған һәм бер үк ваҡытта бер нисә һүҙҙе алдан әйткән Multi-token Prediction (MTP) ысулы моделдең тиҙлеген һәм уның яуабының аныҡлығын арттыра.
- Моделгә махсус белем өлкәләре буйынса кәрәкле яуап эҙләү өсөн «эксперт» өҫтәмә селтәрҙәрен ҡулланылған Mixture of Experts (MoE) технологияһы. DeepSeek-V3-кә шундай 256 нейроселтәр ҡуйылған, уларҙың һигеҙе даими эшләй, башҡалары айырым төр һорауҙы хәл итеү өсөн генә эшкә ҡушыла.
- Multi-head Latent Attention (MLA) моделен көйләүгә түбәнге ранглы аппромаксимация нигеҙендә иғтибар механизмын индереү дәүмәлдең кмәеүенә һәм алдан иҫәпләнгән мәғлүмәтте тиҙ табыу өсөн яуаплы «белем-асҡыс» (KV-cache) парын һаҡлау структураһы эшен тиҙлегенең артыуына килтерә[24].
DeepSeek-R1
2025 йылдың 20 ғинуарында DeepSeek логик һәм математик мәсьәләләрҙе математик AIME һәм MATH та тестарында Open AI-o1 кимәлендә сискәнмDeepSeek R1 уйлаусы моделен тәҡдим итә[4]. Уның айырмалығы шунда: модель яуаптарҙы кеше фекерләгән кеүек бирә[25][26][27]. Уны эшләгәндә компания яңы, моделләштереүҙең һөҙөмтәле ысулын ҡуллана[28].
Баҙарҙың 2025 йылдың ғинуарында төшөүе
Өйрәтеү һәм ҡулланыу башҡа күпкә аҙыраҡ сығымдар талап иткән моделдең сығыуы 2025 йылдың 28 ғинуарында технологик компанияларҙың котировкалары төшөүгә килтерә. Нейроселтәрҙәрҙе өйрәтеү өсөн ҡорамалдар менән тәьмин иткән Nvidia донъя тәьминәтсеһе 600 миллиард доллар йәки или капиаллаштырыуының 18 процентын юғалта. Был фонд баҙары тарихында иң ҙур хаҡ төшөү була[29].
Яһалма аҡыл секторы менән бәйле барлыҡ компаниялар — Аркадий Воложтың Nebius-ы (-4 %) Broadcom (-17,3 %), Advanced Micro Devices (-8 %), Palantir (-7 %), Microsoft (-3 %), шулай уҡ Constellation Energy (-21 %) һәм Vistra (-29 %) дата-үҙәктәрен электр энергияһы менән тәьмин итеүселәр юғалтыу кисерә. NASDAQ индексы 3,5 процентҡа, ә S&P 1,8 процентҡа ултыра. Дөйөм алғанда Америка биржалары 1 триллион АҠШ доллары күләмендә килем юғалта[29], криптовалюталар хаҡы 7 процентҡа кәмей[30].
Технологияларҙы урлауҙа ғәйепләү
29 ғинуарҙа, Microsoft һәм уға ҡараған OpenAI DeepSeek-ҡа ҡаршы тикшереү башлағаны билдәле була. Компаниялар, Ҡытай стартапы үҙенең моделдәрен OpenAI нейроселтәрҙәре туплаған мәғлүмәттәрҙә рөхсәтһеҙ өйрәткән, тип раҫлай[31]. Америка корпорацияһы версияһы буйынса, DeepSeek бойондороҡһоҙ эшләнмә түгел, ә OpenAI эшләгән һәм патентлаған моделдәрҙе таҙартыу ысулы менән булдырылған[32].
Инновация катализаторы булараҡ, АҠШ санкциялары
Моделдәрен өйрәтеү өсөн DeepSeek-тың 2021 йылда уҡ — йәғни АҠШ-тың Ҡытайға чиптар һатыуына сикләүҙәр индерелгәнгә тиклем — алынған Nvidia-ның A100 видеокарталарын ҡулланыуы мәғлүм. Төрлө баһалар буйынса, DeepSeek стартапы ҡарамағында 10 мең дана самаһы шундай видеокарталар бар[7] (ҡайһы бер көнбайыш эксперттары компания Nvidia-ның тағы ла 40 мең H800 видеокартаһына эйә булыуын белдерә[33][34]), OpenAI йәки Llama-нан бер нисә тапҡырға әҙерәк (һәр компания яҡынса 300 мең видеокартаға эйә)[35][36]. Шулай итеп, сикләнгән иҫәпләү ҡеүәте DeepSeek-ты ошо етешһеҙлекте компенсациялаған яңы инновацион архитектура юлдары эҙләргә мәжбүр иткән, күрәһең[37].
Тәнҡит
Anthropic компанияһын нигеҙләүсе, Claude AI тел моделдәренең ҙур серияһына эшләүсе Дарио Амодей, ҡытайҙар юғары һөҙөмтәләргә өлгәшеүҙән алда үҙҙәре тураһында бар донъяға ҡысҡырҙы, тип белдерә. Уның фекеренсә, DeepSeek 7-10 ай элекке Америка моделдәренә яҡын модель эшләгән, бының өсөн сығымдарҙы кәметеү тренды барышында әҙерәк сығымдар сарыф иткән. Өҫтәүенә, Ҡытай стартабының етди ресурстарға инеү мөмкинлеге булған. Амодей, DeepSeek яҡшы һөҙөмтәләр күрһәтә, әммә быны революция тип атарға ярамай, сөнки сығымдарҙың кәмеүе ғәҙәти трендҡа тап килә, шул уҡ ваҡытта DeepSeek-тың дөйөм сығымдары Америка яһалма аҡыл лабораториялары сығымдарына тура килә, бынан тыш, DeepSeek-V3 шау-шыу тыуҙырған DeepSeek-R1-ға ҡарағанда замансараҡ, тип белдерә[38].
Иҫкәрмәләр
- ↑ 1 2 Sharma, Shubham. DeepSeek-V3, ultra-large open-source AI, outperforms Llama and Qwen on launch (26 декабрь 2024). 29 ғинуар 2025 тикшерелгән.
- ↑ 1 2 3 4 5 Нейросеть DeepSeek: что это, возможности, как пользоваться | РБК Тренды. 28 ғинуар 2025 тикшерелгән.
- ↑ 1 2 DeepSeek-V3: Китайская языковая модель превзошла Claude 3.5 Sonnet в работе с кодом. 28 ғинуар 2025 тикшерелгән.
- ↑ 1 2 DataSecrets. Разбираемся, как устроена R1 – новая бесплатная ризонинг модель ИИ из Китая, работающая на уровне o1 от OpenAI. Habr.ru (21 ғинуар 2025).
- ↑ Разбираемся, как устроена R1 – новая бесплатная ризонинг модель ИИ из Китая, работающая на уровне o1 от OpenAI. 28 ғинуар 2025 тикшерелгән.
- ↑ DeepSeek R1: модель с производительностью o1 от OpenAI. Сравнение с o1, сколько стоит и как использовать API. 28 ғинуар 2025 тикшерелгән.
- ↑ 1 2 3 Запад шокирован китайским интеллектом (27 ғинуар 2025). 28 ғинуар 2025 тикшерелгән.
- ↑ «DeepSeek – это победа над сегрегацией человечества»: как китайцы хакнули ИИ-рынок (билдәһеҙ). БИЗНЕС Online. Мөрәжәғәт итеү датаһы: 28 ғинуар 2025.
- ↑ Китайская угроза (27 ғинуар 2025). 28 ғинуар 2025 тикшерелгән.
- ↑ 暗涌. 揭秘DeepSeek:一个更极致的中国技术理想主义故事. 30 ғинуар 2025 тикшерелгән.
- ↑ Schneider, Jordan. Deepseek: The Quiet Giant Leading China’s AI Race. 29 ғинуар 2025 тикшерелгән.
- ↑ Meta's chief AI scientist says DeepSeek's success shows that 'open source models are surpassing proprietary ones'. 28 ғинуар 2025 тикшерелгән.
- ↑ 1 2 Ksenia Se, Alyona Vert. Topic 10: Inside DeepSeek Models. Turing Post (28 август 2024).
- ↑ Wiggers, Kyle. DeepSeek's new AI model appears to be one of the best 'open' challengers yet | TechCrunch (26 декабрь 2024). 29 ғинуар 2025 тикшерелгән.
- ↑ Guo, Daya, Zhu, Qihao, Yang, Dejian, Xie, Zhenda, Dong, Kai, Zhang, Wentao, Chen, Guanting, Bi, Xiao, Wu, Y., Li, Y. K., Luo, Fuli, Xiong, Yingfei, Liang, Wenfeng. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence (инг.) // arXiv.org. — 2024-01-25.
- ↑ 1 2 DeepSeek — очередной квантовый скачок в развитии AI. 28 ғинуар 2025 тикшерелгән.
- ↑ Dai, Damai, Deng, Chengqi, Zhao, Chenggang, Xu, R. X., Gao, Huazuo, Chen, Deli, Li, Jiashi, Zeng, Wangding, Yu, Xingkai, Wu, Y., Xie, Zhenda, Li, Y. K., Huang, Panpan, Luo, Fuli, Ruan, Chong, Sui, Zhifang, Liang, Wenfeng. DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models (инг.) // arXiv.org. — 2024-01-11.
- ↑ Dai, Damai, Deng, Chengqi, Zhao, Chenggang, Xu, R. X., Gao, Huazuo, Chen, Deli, Li, Jiashi, Zeng, Wangding, Yu, Xingkai, Wu, Y., Xie, Zhenda, Li, Y. K., Huang, Panpan, Luo, Fuli, Ruan, Chong, Sui, Zhifang, Liang, Wenfeng. DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models (инг.) // arXiv.org. — 2024-01-11.
- ↑ Большие языковые модели в 2024 году: полное сравнение. www.gptunnel.com. Мөрәжәғәт итеү датаһы: 29 ғинуар 2025.
- ↑ DeepSeek вызвал истерику у Американских ИИ корпораций. 28 ғинуар 2025 тикшерелгән.
- ↑ The Chinese quant fund-turned-AI pioneer, Financial Times (9 June 2024).
- ↑ BFM.ru. Китайская модель ИИ DeepSeek стала лидером по скачиванию в США. 28 ғинуар 2025 тикшерелгән.
- ↑ DeepSeek-AI, Liu, Aixin, Feng, Bei, Xue, Bing, Wang, Bingxuan, Wu, Bochao, Lu, Chengda, Zhao, Chenggang, Deng, Chengqi, Zhang, Chenyu, Ruan и др. DeepSeek-V3 Technical Report (инг.) // arXiv.org. — 2024-12-27.
- ↑ Erdil, Ege. How has DeepSeek improved the Transformer architecture? (17 ғинуар 2025). 29 ғинуар 2025 тикшерелгән.
- ↑ Elizabeth Gibney. China’s cheap, open AI model DeepSeek thrills scientists (инг.) // Nature. — 2025-01-23. — ISSN 1476-4687. — DOI:DOI:10.1038/d41586-025-00229-6.
- ↑ Chowdhury, Hasan KI aus China: Überholt dieses Startup jetzt OpenAI? (нем.). Business Insider (25 ғинуар 2025).
- ↑ Sharma, Shubham Open-source DeepSeek-R1 uses pure reinforcement learning to match OpenAI o1 — at 95% less cost (билдәһеҙ). VentureBeat (20 ғинуар 2025).
- ↑ Moris. DeepSeek, по сути взломал один из святых Граалей ИИ. Smart-Lab (27 ғинуар 2025).
- ↑ 1 2 ИИ-пузырь лопнул: стоимость Nvidia рухнула на $600 млрд за сутки из-за китайского стартапа DeepSeek. 29 ғинуар 2025 тикшерелгән.
- ↑ Рынок криптовалют упал на 7%. Причем тут ИИ-стартап из Китая DeepSeek на NFT.RU (27 ғинуар 2025). 29 ғинуар 2025 тикшерелгән.
- ↑ Microsoft и OpenAI расследуют, обучался ли DeepSeek на украденных данных американских компаний в сфере ИИ. 29 ғинуар 2025 тикшерелгән.
- ↑ BFM.ru. DeepSeek заподозрили в краже технологий OpenAI. 29 ғинуар 2025 тикшерелгән.
- ↑ Overclockers.ru: Одна только китайская компания DeepSeek имеет 50 000 санкционных чипов H100. 28 ғинуар 2025 тикшерелгән.
- ↑ Zafar, Ramish. Chinese AI Lab DeepSeek Has 50,000 NVIDIA H100 AI GPUs, Says AI CEO (25 ғинуар 2025). 30 ғинуар 2025 тикшерелгән.
- ↑ Times, GB. How many gpus does OpenAI have? - GB Times (30 сентябрь 2024). 28 ғинуар 2025 тикшерелгән.
- ↑ DeepSeek вызвал истерику у Американских ИИ корпораций. 28 ғинуар 2025 тикшерелгән.
- ↑ Kelsey Vlamis,Katherine Tangalakis-Lippert. How the US may have unintentionally helped create an AI monster in China. AOL (28 ғинуар 2025).
- ↑ Dario Amodei. Dario Amodei — On DeepSeek and Export Controls (ингл.). darioamodei.com. Мөрәжәғәт итеү датаһы: 30 ғинуар 2025.
Был мәҡәләгә Рувикиның башҡа мәҡәләләре һылтанмай. |

