用戶名
UID
Email
密碼
登錄
自動登錄
找回密碼
註冊
首頁
Portal
XF NEWS
論壇
BBS
夯評測
REVIEW
嗑消息
TRENDS
瘋採訪
INTERVIEW
潮活動
賀得獎
校園活動
最新文章
搜索
搜索
熱搜:
XFastest 最夯的電腦領域
XFastest
夯評測
嗑新聞
瘋採訪
潮活動
速下載
本版
帖子
用戶
XFastest 最夯的電腦領域
»
論壇
›
官方推薦文章
›
業界動態 Industrial Information
›
NVIDIA TensorRT-LLM 增強了 H100 GPU 大型語言模型的推 ...
返回列表
複製連結
發新帖
相關文章
RELATED
NVIDIA 不只做 GPU!88 核心 Vera CPU 正式秀 ...
AWS 與 NVIDIA 將為代理型與物理 AI 新增部 ...
洩漏還試玩!《NBA 2K27 》內置 NVIDIA DLSS ...
NVIDIA DLSS 4.5 光線重建現已推出
DLSS 4.5 與 RTX 遊戲最新消息:《戰爭機器: ...
技嘉攜手 NVIDIA 推出 GeForce RTX™ 50 系列 ...
開學必備!NVIDIA GeForce RTX 50 系列筆電開 ...
NVIDIA 發表「DLSS 5」由 3D 繪圖引導 AI 神 ...
NVIDIA 斥資 35 億美元再結盟聯發科!深化雲 ...
市場反應熱烈!華碩、微星首波 AI 筆電 RTX S ...
夯評測
REVIEW
›
三面曲玻也能兼顧散熱!Antec C6 Curve Air 中塔機殼開箱 / 無立柱全景、垂直風道與多向進氣
AMD 3A平台單通道也能打!Ryzen 7 9800X3D x單通道 16GB RAM 系統 x Radeon RX 9070 XT 遊戲效能測試
AITC S1000、KE680、KM600 Ultra M.2 SSD 開箱測試 / 入門 x 主流 x 旗艦直觀選!
Intel、AMD 雙平台實裝!CORSAIR iCUE LINK TITAN II 360 RX RGB / RX LCD 開箱
最強 AI 武裝!ROG Strix SCAR 18 (2026) G835 開箱測試 / 手動 320W 本地 Armor EdgeAI
電競全景高!ROG Cronox ARGB 機殼開箱組裝 / 4 x Eurux GR120 風扇與 9.2 吋 LCD 螢幕
3D 造景 x 散熱舞台!TCOMAS EXIT D3 PRO 水冷開箱測試 / 三面 LCD 螢幕、LYNK 磁吸風扇
一殼三玩、9 種電源位置!MONTECH TEN 機殼開箱 / 十週年模組化 M-ATX、多種安裝方式
iRocks T36 人體工學椅雙色開箱 / 晨光綠、丹寧藍簡約質感,4D 扶手與舒適支撐兼具
MSI MEG CORELIQUID E15 360 旗艦曲面水冷與 MAESTRO 900R 豪宅開箱測試
文章精選
CHOICE
›
Thunderbolt 5 新款!OWC Express 4M2 Ultra SSD 外接盒 / 緊湊小巧、最高 6622 MBps 傳輸效能
「這體積真香!小巧好看,但這幾個細節你要注意」Lian Li 聯力 B4-mATX 開箱實裝心得分享
「小隻馬裡的千瓦級猛獸!」全漢 FSP DAGGER PM 1200W SFX-L 開箱
VIA 軟體支援 Ducky OK-M-98 緊湊型全尺寸入門三模無線機械鍵盤
AMD 3A平台單通道也能打!Ryzen 7 9800X3D x單通道 16GB RAM 系統 x Radeon RX 9070 XT 遊戲效能測試
ASUS ProArt PA40SU SSD 外接盒開箱 / USB4 40Gbps 高速外接、主動風扇
風扇滿配,視博通高 CP 全新曲面海景 SAC449「速速叫」
【開箱】白色白金認證MIT電源 | FSP VITA PM MIT 1000W WHITE
三面曲玻也能兼顧散熱!Antec C6 Curve Air 中塔機殼開箱 / 無立柱全景、垂直風道與多向進氣
AITC S1000、KE680、KM600 Ultra M.2 SSD 開箱測試 / 入門 x 主流 x 旗艦直觀選!
NVIDIA TensorRT-LLM 增強了 H100 GPU 大型語言模型的推論能力
[顯示卡器]
複製鏈接
打印
上一主題
下一主題
回復
電梯直達
1
#
8532
0
lin.sinchen
發表於 2023-9-11 16:20:37
|
只看該作者
|
只看大圖
|
倒序瀏覽
|
閱讀模式
大型語言模型提供極為出色的新功能,擴大人工智慧潛在的應用領域。不過其龐大規模與獨特的執行特性,很難用具成本效益的方式來使用它們。
NVIDIA 不斷與
Meta
、
AnyScale
、
Cohere
、
Deci
、
Grammarly
、
Mistral AI
、
MosaicML
(現已成為
Databricks
的一員)、
OctoML
、
Tabnine
及 Together AI 等重點企業密切合作,以加快大型語言模型的推論速度及取得最佳的推論結果。
這些創新項目已經整合進開源型態的
NVIDIA TensorRT-LLM
軟體,將在未來幾週內發布。TensorRT-LLM 由 TensorRT 深度學習編譯器組成,包括經最佳化調整的內核、前處理和後處理步驟,以及多GPU/多節點通訊基元,可在 NVIDIA GPU 上創造出突破性的效能表現。它讓開發人員能夠嘗試新的大型語言模型,提供峰值效能和快速自訂功能,而無需具備深厚的 C++ 或 NVIDIA CUDA 相關知識。
TensorRT-LLM 透過開源模組 Python API,提高了易用性和擴充性,可用於定義、最佳化和執行新架構,還會隨著大型語言模型的發展而增強,且能輕鬆自訂相關內容。
例如 MosaicML 在 TensorRT-LLM 的基礎上無縫增加所需的特定功能,並將其整合到推論服務中。Databricks 工程部門副總裁 Naveen Rao 指出:「這絕對是一件輕而易舉的事。」
「TensorRT-LLM 簡單易用,提供包括詞元串流處理(streaming of tokens)、動態批次處理(in-flight batching)、paged-attention、量化等齊全的功能,而且效率出色。它為使用 NVIDIA GPU 的大型語言模型服務提供了最先進的效能,讓我們能夠把省下來的成本回饋給客戶。」Rao 說。
效能比較
摘要文章只是
大型語言模型
的眾多應用項目之一。以下基準測試顯示了 TensorRT-LLM 在最新的 NVIDIA Hopper 架構上所提升的出色效能表現。
下圖反映出使用 NVIDIA A100 和 NVIDIA H100 與 CNN/Daily Mail 進行的文章摘要作業,CNN/Daily Mail 是用於評估摘要表現的著名資料集。
圖 1 中光是 H100 就比 A100 快上四倍。加入 TensorRT-LLM 及其包括動態批次處理在內的各項優勢後,總吞吐量提高了八倍,實現最高吞吐量。
圖
1
:
GPT-J-6B
模型在使用
A100
與
加上和未加上
TensorRT-LLM
的
H100
效能比較
Text summarization, variable I/O length, CNN / DailyMail dataset | A100 FP16 PyTorch eager mode | H100 FP8 | H100 FP8, in-flight batching, TensorRT-LLM
Llama 2 是 Meta 近期發布的一款熱門語言模型,受到想要採用生成式人工智慧的企業廣泛使用,而 TensorRT-LLM 在 Llama 2 模型上進行推論的表現是 A100 GPU 的 4.6 倍。
圖
2
:
700
億個參數的
Llama 2
模型在使用
A100
與加上和未加上
TensorRT-LLM
的
H100
效能比較
Text summarization, variable I/O length, CNN / DailyMail dataset | A100 FP16 PyTorch eager mode| H100 FP8 | H100 FP8, in-flight batching, TensorRT-LLM
大型語言模型生態系統呈現爆炸性發展
生態系統正在快速創新,發展出全新多樣化的模型架構。更大的模型釋放出新的功能和使用範例。像是 Meta 旗下擁有 700 億個參數的 Llama 2,這一類最大、最先進的語言模型需要多個 GPU 協同工作,才能即時提供回應。開發人員過去如果想獲得最佳的大型語言模型推論表現,就必須重寫和手動將人工智慧模型分割成多個片段,然後跨多個 GPU 協調執行。
TensorRT-LLM 使用一種模型平行化(model parallelism)的
tensor 平行
,將個別權重矩陣分割到各個裝置上。如此一來便能以大規模高效率的方式進行推論 - 可以在透過 NVLink 連接的多個 GPU 和多個伺服器上平行運作每個模型,無需開發人員出手干預或修改模型。
隨著推出新模型和模型架構,開發人員可以利用 TensorRT-LLM 中開源型態的最新 NVIDIA 人工智慧內核,將其模型調整至最佳狀態。支援的內核融合包括尖端的FlashAttention 和 Masked Multi-Head Attention技術,用於GPT模型執行的上下文和生成階段,以及許多其他功能。
此外,TensorRT-LLM 還包括當今生產環境中已廣泛使用的許多大型語言模型的完全最佳化、可立即運行版本。其中包括 Meta Llama 2、OpenAI GPT-2 和 GPT-3、Falcon、Mosaic MPT、BLOOM 及其他十幾種,都能透過簡單易用的 TensorRT-LLM Python API 來操作這些大型語言模型。
這些功能可幫助開發人員更快、更準確地開發自訂的大型語言模型,以滿足幾乎各行各業的需求。
動態批次處理
當今的大型語言模型極為多樣化。一個模型可同時用於處理多種彼此間差異極大的任務。從聊天機器人中簡單的一問一答,到文件摘要或生成長篇程式碼,要用高度動態的方式來處理這些工作,而輸出的大小則是天差地遠。
這種多功能性可能會導致難以有效地批量處理請求並行執行它們(而這是用於服務神經網路時常見的最佳化方式),造成某些請求比其他請求更早完成。
為了管理這些動態負載,TensorRT-LLM 包含了一種稱為動態批次處理(in-flight batching)_的最佳調度技術。這項技術讓一個大型語言模型的整體文字生成過程可拆分成在模型上執行的多次迭代。
TensorRT-LLM 利用動態批次處理技術,不會等到整個批次處理完成後再處理下一組請求,而是會立即從批次處理中移除已經完成的序列。在其他請求仍被處理中,它就開始執行新的請求。動態批次處理與額外的內核級最佳化技術提高了 GPU 的使用率,將 H100 Tensor 核心 GPU 上實際 LLM 請求基準的吞吐量最少提高了一倍,有助於漸少能耗以及將總持有成本降至最低。
H100 Transformer
引擎加上
FP8
大型語言模型內有數十億個模型權重和啟動項目,通常使用 16 位元浮點(FP16 或 BF16)值進行訓練和表示,每個值佔用 16 位元記憶體。然而,在推論過程中,大多數模型可以使用現代量化技術有效地表示為較低精度,如8位甚至4位整數(INT8或INT4)。
量化是在不失準確度的前提下,降低模型權重和啟動精度的過程。使用更低精度代表每個參數更小,模型佔用 GPU 記憶體的空間也更小。這樣就能在相同硬體條件下對更大的模型進行推論,同時在執行過程中減少記憶體運作時間。
NVIDIA H100
GPU 加上 TensorRT-LLM,讓使用者能夠輕鬆將模型權重轉換為新的 FP8 格式,並自動編譯模型以利用最佳化的 FP8 內核。在 Hopper
Transformer 引擎
技術實現的,無需更動任何模型程式碼。
H100 引入的 FP8 資料格式使得開發人員能夠量化他們的模型,並在不降低模型準確度的情況下大幅減少記憶體消耗。與 INT8 或 INT4 等其他資料格式相比,FP8 量化保留了更高的準確度,同時做到最快的效能表現和最簡單的實現。
結語
大型語言模型的發展日新月異。每天都開發出不同的模型架構,促進生態系統不斷發展。而大型模型也會釋放出新的功能和使用範例,推動各產業加以採用。
大型語言模型推論技術為資料中心打開新的局面。更出色的效能及更高的準確性為企業降低了總持有成本。模型創新能夠創造出更美好的客戶體驗,進而帶來更高的收入和收益。
在規劃推論部署項目之際,要利用最先進的 LLM 達到最佳效能,仍要考慮許多其他因素。最佳化這件事很少會自動進行。使用者必須考慮平行、端到端工作流程和先進調度技術等微調模型的因素。他們還要有一個能夠處理混合精度,又不會降低準確度的運算平台。
TensorRT-LLM 包括 TensorRT 的深度學習編譯器、最佳化的內核、前處理和後處理,以及在一個簡單的、開源的Python API中實現多GPU/多節點通訊,用於定義、最佳化和執行大型語言模型,以進行生產環境中的推論。
更多圖片
小圖
大圖
NVIDIA6.jpg
(69.51 KB, 下載次數: 125)
下載附件
保存到相冊
2023-9-11 16:20 上傳
組圖打開中,請稍候......
回復
使用道具
舉報
提升卡
置頂卡
沉默卡
喧囂卡
變色卡
顯身卡
發新帖
返回列表
複製連結
高級模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登錄後才可以回帖
登錄
|
註冊
本版積分規則
發表回復
回帖後跳轉到最後一頁
瀏覽過的版塊
活動採訪 Activities Coverage
非敗不可 Buy it
廠商新聞 News
報馬仔 Break new
散熱改裝 Cooling Factor
工作機會 Job vacancy
Windows應用軟體 Applications
新手報到區
ComputeX 2008Taipei
快速回復
返回頂部
返回列表