DeepSeek創辦人擬訓練8萬億參數模型 稱優先使用華為晶片

據美國科技媒體The Information報道,中國內地人工智能(AI)初創公司DeepSeek的創辦人梁文鋒透露,公司正積極推動使用更多國產晶片來訓練其AI模型。他特別指出,DeepSeek計劃優先採用華為的晶片,並預計華為最快有望於今年第四季或明年第一季交付用於模型訓練所需的晶片。 梁文鋒向投資者闡述,DeepSeek目前正在訓練一個規模達2萬億參數的大型模型,此模型參數量已超越其現有V4旗艦模型的1.4萬億參數。此外,公司已定下更為宏大的目標,計劃未來訓練一個高達8萬億參數的巨型模型。梁文鋒強調,基於華為或其他國產處理器進行模型訓練,是DeepSeek一項「最大的押注」,並視此為公司必須成功的重要戰略方向。 市場消息指,DeepSeek目前正在訓練的2萬億參數模型,預期將是即將發布的DeepSeek V4.1 Pro。內地媒體有傳,該模型發布時間可能落在10月中旬至下旬。訓練如此規模的大模型,對算力需求極高。據業界估算,一個2萬億參數的大模型約需處理50萬至60萬億詞元(Token)數據。 按照目前的顯卡算力進行評估,若採用輝達(NVIDIA)H100/H200晶片,訓練該模型需約3萬張;若使用性能更強的B200晶片,則約需1.5萬張。在國產替代方案方面,華為昇騰910C晶片估計需要6萬張,而性能與H200系列相近的華為昇騰950系列晶片,則估計需約3萬張。這些數據反映了不同晶片方案在支撐大規模AI訓練上的效能差異,同時也凸顯了國內廠商在推進自主可控AI算力方面的努力。
TimeNews
09-22 14:06Sumsub推企業員工身分驗證方案 強調堵塞AI欺詐漏洞
09-22 14:06阿里巴巴-W(09988)錄兩宗大手成交 涉資逾5700萬元
09-22 14:06騰訊控股(00700)錄六宗大手成交 涉資逾1.4億元
09-22 14:06盈富基金(02800)錄四宗大手成交 涉資逾1.2億元
09-22 14:05OCBC華僑銀行香港贊助香港耀能協會 啟動「小種子」培幼計劃支援SEN幼兒家庭
09-22 14:05港大與瑞銀合辦可持續領導課程圓滿結束 培育非牟利界新世代領袖
09-22 13:37零售商拓展新市場機遇與挑戰並存 Adyen報告揭八成八商户曾遇支付欺詐
09-22 13:37阿里巴巴(09988)推新一代AI晶片「真武V900」 稱中國性能最強 劍指大模型訓練市場
09-22 13:37美銀證券評估中國離岸追税對港股影響 料屬個股層面;並揭示中國AI產業兩大「護城河」
09-22 13:37美銀證券料離岸追税影響有限 AI價值鏈具兩大「護城河」
09-22 13:36中際旭創 (03308) 錄逾2,265萬元大手成交 引市場關注
09-22 13:36建滔積層板(01888)盤中錄得大手成交 涉資逾2,876萬元
09-22 13:36騰訊控股(00700)錄大手成交 涉資逾3700萬元
09-22 13:36阿里巴巴-W錄逾2000萬元大手成交 涉資2063萬元
09-22 13:36攜程集團-S (09961) 錄兩宗大手成交 涉資逾1.14億元
09-22 13:35仲量聯行獨家代理堅尼地城海怡花園基座舖位放售 叫價1.8億元
09-22 13:35DeepSeek創辦人擬訓練8萬億參數模型 稱優先使用華為晶片
09-22 13:35盈富基金(02800)午後現7宗大手交易 涉資逾2億元
09-22 13:35國際調解院首辦「全球對話」爐邊談話 探討國際調解關鍵角色
09-22 13:35中美關係受全球矚目 習近平訪美前新華社署名文章指引航向