用戶名
UID
Email
密碼
登錄
自動登錄
找回密碼
註冊
首頁
Portal
XF NEWS
論壇
BBS
夯評測
REVIEW
嗑消息
TRENDS
瘋採訪
INTERVIEW
潮活動
Events
校園活動
最新文章
搜索
搜索
熱搜:
XFastest 最夯的電腦領域
XFastest
夯評測
嗑新聞
瘋採訪
潮活動
速下載
本版
帖子
用戶
XFastest 最夯的電腦領域
»
論壇
›
官方推薦文章
›
業界動態 Industrial Information
›
NVIDIA AI 平台為大型語言模型 NeMo Megatron 框架帶來 ...
返回列表
複製連結
發新帖
相關文章
RELATED
AMD攜手Anthropic部署2GW AI運算平台,Helios ...
專為自駕計程車與自駕車打造的前沿開放模型 ...
顯示卡漲價潮擴大!亞洲市場傳最高調漲40%,R ...
怕 RTX 5090 又燒接頭!玩家自製防燒工具,單 ...
買 RTX 5090 竟綁一堆主機板!臺灣通路超狂組 ...
RTX 4080直接魔改32GB!中國二手市場大量出現 ...
96GB 顯卡價格近乎翻倍!NVIDIA RTX PRO 6000 ...
雕妹來了!技嘉推出 AORUS GeForce RTX 5060 ...
為何擴展 AI 運算效能需要 800 VDC 全新電力 ...
NVIDIA Nemotron 3.5 Lightning 與 NeMo Swit ...
夯評測
REVIEW
›
電競全景高!ROG Cronox ARGB 機殼開箱組裝 / 4 x Eurux GR120 風扇與 9.2 吋 LCD 螢幕
3D 造景 x 散熱舞台!TCOMAS EXIT D3 PRO 水冷開箱測試 / 三面 LCD 螢幕、LYNK 磁吸風扇
一殼三玩、9 種電源位置!MONTECH TEN 機殼開箱 / 十週年模組化 M-ATX、多種安裝方式
iRocks T36 人體工學椅雙色開箱 / 晨光綠、丹寧藍簡約質感,4D 扶手與舒適支撐兼具
MSI MEG CORELIQUID E15 360 旗艦曲面水冷與 MAESTRO 900R 豪宅開箱測試
波紋 CP 有型!SAMA V42 BK 開箱組裝 / 波紋鋁框前門、USB-C 20Gbps、4顆 ARGB 流光風扇
新生報到!GIGABYTE EAGLE GL6J 開箱測試 / GiMATE AI 輔助文書筆電
RGB QD-OLED 第二彈!ROG Strix OLED XG34WCDMS 電競螢幕開箱 / 21:9, 1800R, 280Hz
雪白銀 x 慵懶雕妹!技嘉 B850 AORUS ELITE-P ICE 開箱測試 / 雕妹 ARI 塗裝、規格友善升級
輕量無線!CORSAIR HS35 v3 WIRELESS 電競耳機開箱 / 三模連線、Dolby Atmos、30 小時續航
文章精選
CHOICE
›
高CP值便宜千瓦白金白色登場 FSP 全漢 VITA 1000W PM
電競全景高!ROG Cronox ARGB 機殼開箱組裝 / 4 x Eurux GR120 風扇與 9.2 吋 LCD 螢幕
君主MONTECH TEN十周年紀念款機殼-緊湊型模組化設計加上組態變換,一顆機殼三種體驗
重新定義電競視覺巔峰-GIGABYTE 技嘉 GO27Q24G Gaming Monitor 電競螢幕體驗心得分享
3D 造景 x 散熱舞台!TCOMAS EXIT D3 PRO 水冷開箱測試 / 三面 LCD 螢幕、LYNK 磁吸風扇
一殼三玩、9 種電源位置!MONTECH TEN 機殼開箱 / 十週年模組化 M-ATX、多種安裝方式
君主Montech PureFlow 360水冷-簡單掛一下
喬思伯JONSBO DS916 9.16吋IPS副螢幕-輕薄方便好安裝,橫豎顯示皆宜,輕鬆增添你的視覺饗宴
技嘉GO27Q24G-入門WOLED的救贖
雞蛋糕爸爸開箱之戰速型螢幕GIGABYTE 技嘉GO27Q24G Gaming Monitor 靚亮登場
NVIDIA AI 平台為大型語言模型 NeMo Megatron 框架帶來 30% 訓練速度提升
[業界新聞]
複製鏈接
打印
上一主題
下一主題
回復
電梯直達
1
#
8765
0
lin.sinchen
發表於 2022-7-31 06:00:00
|
只看該作者
|
只看大圖
|
倒序瀏覽
|
閱讀模式
大型語言模型 (large language model; LLM) 的規模和複雜性日益增加,NVIDIA 宣布推出 NeMo Megatron 框架的更新內容,更新後可加快訓練速度達 30%。這些更新內容包括兩項開創性技術及一項超參數工具,用在任意 GPU 數量的 LLM 訓練最佳化及擴展,為使用 NVIDIA AI 平台訓練與部署模型提供新的功能。
全球最大的開放科學、開放取用的多語言模型
BLOOM
,內有 1,760 億個參數,日前在
NVIDIA AI 平台進行訓練
,能夠產出 46 個語言及 13 種程式語言的文字。NVIDIA AI 平台亦支援其中一個擁有 5,300 億個參數的強大 Transformer 語言模型,即
Megatron-Turing NLG
模型 (MT-NLG)。
在
LLM
領域的最新進展
LLM 是當今最重要的先進技術之一,模型內有數兆個參數,可以從文字中進行學習。但開發 LLM 是個昂貴且耗時的過程,須運用深厚的技術能力、分散式基礎設施與完整堆疊才得以完成。
LLM 在推動即時生成內容、文字摘要、客服聊天機器人與透過對話式人工智慧 (AI) 介面的問答等領域,卻能帶來莫大的好處。為了推動 LLM 的發展,AI 領域的開發人員不斷運用包含
Megatron-LM
、
Apex
與其他 GPU 加速函式庫的NVIDIA AI 平台來創新開發工具,像是
微軟 DeepSpeed
、
Colossal-AI
、
Hugging Face BigScience
及
Fairscale
。
在 NVIDIA AI 平台推出新的最佳化內容後,能解決整個堆疊中現有的多項痛點。NVIDIA 期待持續與AI 社群合作,讓每個人都能運用 LLM 的強大實力。
縮短
LLM
開發時間
最新的 NeMo Megatron 更新內容可加快 30% 的 GPT-3 模型訓練速度,模型從 220 億個參數,大至 1 兆個參數都可順利運行。現在使用 1,024 個 NVIDIA A100 GPU,只要 24 天就能訓練出多達 1,750 億個參數的模型,相較於過往版本,訓練時間縮短 10 天,相當於約 25 萬個 GPU 運算小時。
NeMo Megatron 是一個快速、高效且易用的端到端容器化框架,用於收集資料、訓練大型模型、按照業界標準基準評估模型,與以最先進的延遲與傳輸量表現進行推論。
使用 NeMo Megatron,便能在多種 GPU 叢集配置上輕鬆處理並複製 LLM 的訓練和推論作業。目前搶先體驗的客戶可以取得這些功能,在
NVIDIA DGX SuperPODs
、
NVIDIA DGX Foundry
及 Microsoft Azure 雲端環境中運行,並且即將開放支援其他雲端平台。
目前已開放在
NVIDIA LaunchPad
上體驗這些功能。NVIDIA LaunchPad 是一項免費的計畫,提供使用者短期內使用 NVIDIA 加速基礎設施中的多個實作實驗室。
NeMo Megatron 是 NeMo 的一部分。NeMo 是用於為對話式 AI、語音 AI 和生物學打造高效能與靈活應用程式的開源框架。
兩項新技術可加快
LLM
的訓練速度
更新項目包括兩項用於最佳化及擴展 LLM 訓練的新技術,即序列平行 (sequence parallelism; SP) 與選擇性激發再運算 (selective activation recomputation; SAR)。
藉由察覺先前未進行平行化的 transformer 層區域在序列維度上是各自獨立,序列平行擴大了 tensor 級模型的平行性。
沿著序列維度拆分這些層就能進行分散運算,而最重要的是,這些區域的激發記憶體分布於 tensor 平行裝置上。由於以分散方式加以激發,可將更多激發作用保留用於反向運算,而不用重新運算。
圖一
_transformer
層內的平行模式
不同的激發作用需要不同的操作次數來重新運算,選擇性激發再運算改善因記憶體限制而部分被迫重新運算,而非全部激發的情況。除了增加檢查點和重新運算整個 transformer 層,亦可建立檢查點及重新運算每個 transformer 層中,佔用大量記憶體但重新運算的成本不高的部分。
如欲瞭解更多相關資訊,請見《
Reducing Activation Recomputation in Large Transformer Models
》。
圖二
_
Self-attention
模塊。紅色虛線代表應用選擇性激發重新運算的區域
圖三
_SP
與
SAR
將激發記憶體保留用於反向運算。隨著模型大小的增加,
SP
與
SAR
皆具類似的記憶體保留能力,將所需的記憶體數量減少五倍
圖四
_
完全激發再運算與
SP
加上
SAR
的運算時間。長條圖細分出每層的前向、反向和重新運算時間。基線是無採用重新運算和序列平行時的情況。這些技術能在所有激發都被重新運算
(
而非保留
)
時有效減少額外的運算時間。最大模型的額外時間從
36%
降至僅
2%
要配合高度最佳化的推論策略,才能發揮 LLM 的強大實力。使用者可以輕鬆將訓練好的模型用於推論,並且利用 p-tuning 及 prompt tuning 功能對不同的使用情況進行最佳化調整。
這些功能可以取代微調,讓 LLM 可以適應新的使用情況,無需繁瑣地對完整預先訓練好的模型進行微調。該技術不會更動原始模型裡的參數,便能避免發生因微調模型而出現的災難性「遺忘」問題。欲瞭解更多相關資訊,請見《
Adapting P-Tuning to Solve Non-English Downstream Tasks
》。
用於訓練和推論的全新超參數工具
在分散式基礎設施中找出適合 LLM 的模型配置非常耗時。NeMo Megatron 推出一項超參數工具,可以自動尋找最佳的訓練和推論配置,且無需修改程式碼。如此一來,LLM 只要一上線便能接受訓練以進行推論收斂,不用浪費時間去尋找高效的模型配置。
NeMo Megatron 使用啟發式方法和經驗網格,在不同參數之間尋找有著最佳傳輸量的配置:資料平行、tensor 平行、流程平行、序列平行、微批次大小與激發檢查點層的數量 (包括選擇性激發重新運算)。
在 NGC 的容器上使用超參數工具與 NVIDIA 測試,在不到 24 小時內便替一個有著 175B GPT-3 模型達到最佳訓練配置 (請見圖五)。與使用完全激發重新運算的一般配置相比,傳輸量速度提高 20% 到 30%。使用最新技術,讓具有超過 20B 參數的模型速度可再加快 10% 到 20%。
圖五
_
將超參數工具用於多個容器上的結果顯示,使用序列平行和選擇性激發重新運算,
有助於加快處理速度,其中每個節點皆搭載
NVIDIA DGX A100
超參數工具亦能找出推論過程中,有著最高傳輸量或最低延遲的模型配置。模型可以獲得延遲和傳輸量限制資訊,而該工具將會推薦合適的配置。
圖六
_
超參數工具的推論結果顯示每個
GPU
的傳輸量及不同配置的延遲情況。
最佳配置包括高傳輸量及低延遲
欲瞭解更多關於適用於 LLM 的 NVIDIA AI 平台最新更新內容,
敬請申請搶先體驗 NeMo Megatron
。企業亦能
在 NVIDIA LaunchPad 上免費體驗 NeMo Megatron
。
更多圖片
小圖
大圖
NVIDIA.jpg
(26.86 KB, 下載次數: 63)
下載附件
保存到相冊
2022-7-30 21:04 上傳
組圖打開中,請稍候......
回復
使用道具
舉報
提升卡
置頂卡
沉默卡
喧囂卡
變色卡
顯身卡
發新帖
返回列表
複製連結
高級模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登錄後才可以回帖
登錄
|
註冊
本版積分規則
發表回復
回帖後跳轉到最後一頁
瀏覽過的版塊
新手報到區
電競產品 Gaming Accessories
散熱改裝 Cooling Factor
線上活動
Windows應用軟體 Applications
頭條文章 Headline News
報好康區
Windows based
機殼電源 PowerSupply & Chassis
快速回復
返回頂部
返回列表