用戶名
UID
Email
密碼
登錄
自動登錄
找回密碼
註冊
XFastest ??
XFastest ??
首頁
Portal
XF NEWS
論壇
BBS
夯評測
REVIEW
嗑消息
TRENDS
瘋採訪
INTERVIEW
潮活動
Events
校園活動
最新文章
搜索
搜索
熱搜:
XFastest 最夯的電腦領域
XFastest
夯評測
嗑新聞
瘋採訪
潮活動
速下載
本版
帖子
用戶
XFastest 最夯的電腦領域
»
論壇
›
官方推薦文章
›
業界動態 Industrial Information
›
NVIDIA AI 平台為大型語言模型 NeMo Megatron 框架帶來 ...
返回列表
複製連結
發新帖
相關文章
RELATED
AMD攜手Anthropic部署2GW AI運算平台,Helios ...
專為自駕計程車與自駕車打造的前沿開放模型 ...
顯示卡漲價潮擴大!亞洲市場傳最高調漲40%,R ...
怕 RTX 5090 又燒接頭!玩家自製防燒工具,單 ...
買 RTX 5090 竟綁一堆主機板!臺灣通路超狂組 ...
RTX 4080直接魔改32GB!中國二手市場大量出現 ...
96GB 顯卡價格近乎翻倍!NVIDIA RTX PRO 6000 ...
雕妹來了!技嘉推出 AORUS GeForce RTX 5060 ...
為何擴展 AI 運算效能需要 800 VDC 全新電力 ...
NVIDIA Nemotron 3.5 Lightning 與 NeMo Swit ...
夯評測
REVIEW
›
3D 造景 x 散熱舞台!TCOMAS EXIT D3 PRO 水冷開箱測試 / 三面 LCD 螢幕、LYNK 磁吸風扇
一殼三玩、9 種電源位置!MONTECH TEN 機殼開箱 / 十週年模組化 M-ATX、多種安裝方式
iRocks T36 人體工學椅雙色開箱 / 晨光綠、丹寧藍簡約質感,4D 扶手與舒適支撐兼具
MSI MEG CORELIQUID E15 360 旗艦曲面水冷與 MAESTRO 900R 豪宅開箱測試
波紋 CP 有型!SAMA V42 BK 開箱組裝 / 波紋鋁框前門、USB-C 20Gbps、4顆 ARGB 流光風扇
新生報到!GIGABYTE EAGLE GL6J 開箱測試 / GiMATE AI 輔助文書筆電
RGB QD-OLED 第二彈!ROG Strix OLED XG34WCDMS 電競螢幕開箱 / 21:9, 1800R, 280Hz
雪白銀 x 慵懶雕妹!技嘉 B850 AORUS ELITE-P ICE 開箱測試 / 雕妹 ARI 塗裝、規格友善升級
輕量無線!CORSAIR HS35 v3 WIRELESS 電競耳機開箱 / 三模連線、Dolby Atmos、30 小時續航
復古小巧高擴充!SilverStone FLP03 開箱組裝 / mATX 緊湊、預裝 18cm大風扇、雙 I/O 面板
文章精選
CHOICE
›
電競全景高!ROG Cronox ARGB 機殼開箱組裝 / 4 x Eurux GR120 風扇與 9.2 吋 LCD 螢幕
君主MONTECH TEN十周年紀念款機殼-緊湊型模組化設計加上組態變換,一顆機殼三種體驗
重新定義電競視覺巔峰-GIGABYTE 技嘉 GO27Q24G Gaming Monitor 電競螢幕體驗心得分享
3D 造景 x 散熱舞台!TCOMAS EXIT D3 PRO 水冷開箱測試 / 三面 LCD 螢幕、LYNK 磁吸風扇
一殼三玩、9 種電源位置!MONTECH TEN 機殼開箱 / 十週年模組化 M-ATX、多種安裝方式
君主Montech PureFlow 360水冷-簡單掛一下
喬思伯JONSBO DS916 9.16吋IPS副螢幕-輕薄方便好安裝,橫豎顯示皆宜,輕鬆增添你的視覺饗宴
技嘉GO27Q24G-入門WOLED的救贖
雞蛋糕爸爸開箱之戰速型螢幕GIGABYTE 技嘉GO27Q24G Gaming Monitor 靚亮登場
40週年超頻特仕板 技嘉 X870 AORUS INFINITY
NVIDIA AI 平台為大型語言模型 NeMo Megatron 框架帶來 30% 訓練速度提升
[業界新聞]
複製鏈接
打印
上一主題
下一主題
回復
電梯直達
1
#
8757
0
lin.sinchen
發表於 2022-7-31 06:00:00
|
只看該作者
|
只看大圖
|
倒序瀏覽
|
閱讀模式
大型語言模型 (large language model; LLM) 的規模和複雜性日益增加,NVIDIA 宣布推出 NeMo Megatron 框架的更新內容,更新後可加快訓練速度達 30%。這些更新內容包括兩項開創性技術及一項超參數工具,用在任意 GPU 數量的 LLM 訓練最佳化及擴展,為使用 NVIDIA AI 平台訓練與部署模型提供新的功能。
全球最大的開放科學、開放取用的多語言模型
BLOOM
,內有 1,760 億個參數,日前在
NVIDIA AI 平台進行訓練
,能夠產出 46 個語言及 13 種程式語言的文字。NVIDIA AI 平台亦支援其中一個擁有 5,300 億個參數的強大 Transformer 語言模型,即
Megatron-Turing NLG
模型 (MT-NLG)。
在
LLM
領域的最新進展
LLM 是當今最重要的先進技術之一,模型內有數兆個參數,可以從文字中進行學習。但開發 LLM 是個昂貴且耗時的過程,須運用深厚的技術能力、分散式基礎設施與完整堆疊才得以完成。
LLM 在推動即時生成內容、文字摘要、客服聊天機器人與透過對話式人工智慧 (AI) 介面的問答等領域,卻能帶來莫大的好處。為了推動 LLM 的發展,AI 領域的開發人員不斷運用包含
Megatron-LM
、
Apex
與其他 GPU 加速函式庫的NVIDIA AI 平台來創新開發工具,像是
微軟 DeepSpeed
、
Colossal-AI
、
Hugging Face BigScience
及
Fairscale
。
在 NVIDIA AI 平台推出新的最佳化內容後,能解決整個堆疊中現有的多項痛點。NVIDIA 期待持續與AI 社群合作,讓每個人都能運用 LLM 的強大實力。
縮短
LLM
開發時間
最新的 NeMo Megatron 更新內容可加快 30% 的 GPT-3 模型訓練速度,模型從 220 億個參數,大至 1 兆個參數都可順利運行。現在使用 1,024 個 NVIDIA A100 GPU,只要 24 天就能訓練出多達 1,750 億個參數的模型,相較於過往版本,訓練時間縮短 10 天,相當於約 25 萬個 GPU 運算小時。
NeMo Megatron 是一個快速、高效且易用的端到端容器化框架,用於收集資料、訓練大型模型、按照業界標準基準評估模型,與以最先進的延遲與傳輸量表現進行推論。
使用 NeMo Megatron,便能在多種 GPU 叢集配置上輕鬆處理並複製 LLM 的訓練和推論作業。目前搶先體驗的客戶可以取得這些功能,在
NVIDIA DGX SuperPODs
、
NVIDIA DGX Foundry
及 Microsoft Azure 雲端環境中運行,並且即將開放支援其他雲端平台。
目前已開放在
NVIDIA LaunchPad
上體驗這些功能。NVIDIA LaunchPad 是一項免費的計畫,提供使用者短期內使用 NVIDIA 加速基礎設施中的多個實作實驗室。
NeMo Megatron 是 NeMo 的一部分。NeMo 是用於為對話式 AI、語音 AI 和生物學打造高效能與靈活應用程式的開源框架。
兩項新技術可加快
LLM
的訓練速度
更新項目包括兩項用於最佳化及擴展 LLM 訓練的新技術,即序列平行 (sequence parallelism; SP) 與選擇性激發再運算 (selective activation recomputation; SAR)。
藉由察覺先前未進行平行化的 transformer 層區域在序列維度上是各自獨立,序列平行擴大了 tensor 級模型的平行性。
沿著序列維度拆分這些層就能進行分散運算,而最重要的是,這些區域的激發記憶體分布於 tensor 平行裝置上。由於以分散方式加以激發,可將更多激發作用保留用於反向運算,而不用重新運算。
圖一
_transformer
層內的平行模式
不同的激發作用需要不同的操作次數來重新運算,選擇性激發再運算改善因記憶體限制而部分被迫重新運算,而非全部激發的情況。除了增加檢查點和重新運算整個 transformer 層,亦可建立檢查點及重新運算每個 transformer 層中,佔用大量記憶體但重新運算的成本不高的部分。
如欲瞭解更多相關資訊,請見《
Reducing Activation Recomputation in Large Transformer Models
》。
圖二
_
Self-attention
模塊。紅色虛線代表應用選擇性激發重新運算的區域
圖三
_SP
與
SAR
將激發記憶體保留用於反向運算。隨著模型大小的增加,
SP
與
SAR
皆具類似的記憶體保留能力,將所需的記憶體數量減少五倍
圖四
_
完全激發再運算與
SP
加上
SAR
的運算時間。長條圖細分出每層的前向、反向和重新運算時間。基線是無採用重新運算和序列平行時的情況。這些技術能在所有激發都被重新運算
(
而非保留
)
時有效減少額外的運算時間。最大模型的額外時間從
36%
降至僅
2%
要配合高度最佳化的推論策略,才能發揮 LLM 的強大實力。使用者可以輕鬆將訓練好的模型用於推論,並且利用 p-tuning 及 prompt tuning 功能對不同的使用情況進行最佳化調整。
這些功能可以取代微調,讓 LLM 可以適應新的使用情況,無需繁瑣地對完整預先訓練好的模型進行微調。該技術不會更動原始模型裡的參數,便能避免發生因微調模型而出現的災難性「遺忘」問題。欲瞭解更多相關資訊,請見《
Adapting P-Tuning to Solve Non-English Downstream Tasks
》。
用於訓練和推論的全新超參數工具
在分散式基礎設施中找出適合 LLM 的模型配置非常耗時。NeMo Megatron 推出一項超參數工具,可以自動尋找最佳的訓練和推論配置,且無需修改程式碼。如此一來,LLM 只要一上線便能接受訓練以進行推論收斂,不用浪費時間去尋找高效的模型配置。
NeMo Megatron 使用啟發式方法和經驗網格,在不同參數之間尋找有著最佳傳輸量的配置:資料平行、tensor 平行、流程平行、序列平行、微批次大小與激發檢查點層的數量 (包括選擇性激發重新運算)。
在 NGC 的容器上使用超參數工具與 NVIDIA 測試,在不到 24 小時內便替一個有著 175B GPT-3 模型達到最佳訓練配置 (請見圖五)。與使用完全激發重新運算的一般配置相比,傳輸量速度提高 20% 到 30%。使用最新技術,讓具有超過 20B 參數的模型速度可再加快 10% 到 20%。
圖五
_
將超參數工具用於多個容器上的結果顯示,使用序列平行和選擇性激發重新運算,
有助於加快處理速度,其中每個節點皆搭載
NVIDIA DGX A100
超參數工具亦能找出推論過程中,有著最高傳輸量或最低延遲的模型配置。模型可以獲得延遲和傳輸量限制資訊,而該工具將會推薦合適的配置。
圖六
_
超參數工具的推論結果顯示每個
GPU
的傳輸量及不同配置的延遲情況。
最佳配置包括高傳輸量及低延遲
欲瞭解更多關於適用於 LLM 的 NVIDIA AI 平台最新更新內容,
敬請申請搶先體驗 NeMo Megatron
。企業亦能
在 NVIDIA LaunchPad 上免費體驗 NeMo Megatron
。
更多圖片
小圖
大圖
NVIDIA.jpg
(26.86 KB, 下載次數: 63)
下載附件
保存到相冊
2022-7-30 21:04 上傳
組圖打開中,請稍候......
回復
使用道具
舉報
提升卡
置頂卡
沉默卡
喧囂卡
變色卡
顯身卡
發新帖
返回列表
複製連結
高級模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登錄後才可以回帖
登錄
|
註冊
本版積分規則
發表回復
回帖後跳轉到最後一頁
瀏覽過的版塊
ComputeX 2009
非敗不可 Buy it
Windows應用軟體 Applications
廠商新聞 News
散熱改裝 Cooling Factor
Windows based
2011 台中網聚
儲存燒錄 Burn-IN & HDD & SSD & NAS
頭條文章 Headline News
快速回復
返回頂部
返回列表