新聞
2026-09-22 13:24:18

DeepSeek擬訓練8萬億參數模型優先使用華為晶片

美國科技媒體The Information報道,內地人工智能(AI)初創DeepSeek創辦人梁文鋒透露,冀使用更多國產晶片來訓練模型,華為最快第四季或明年首季可交付晶片作訓練。 梁文鋒向投資者表示,DeepSeek正訓練一個2萬億參數模型,並已超過其V4旗艦模型的1.4萬億參數,另將計劃訓練一個8萬億參數的模型。 他稱,基於華為或其他國產處理器進行訓練是DeepSeek「最大的押注之一」,而這項工作必須成功,DeepSeek亦會計劃優先使用華為晶片來訓練模型。 內地媒體報道,2萬億參數模型預期是將發布的DeepSeek V4.1 Pro,傳或10月中旬至下旬發布的機會大。訓練2萬億參數量大模型需要50萬至60萬億詞元(Token),按照目前顯卡算力估算,輝達H100/H200晶片需要3萬張,B200則需要1.5萬張,華為昇騰910C需要6萬張,如果是華為昇騰950系列需3萬張,跟H200差不多。 (WL)

<匯港通訊>