NVIDIA · Ada Lovelace Architecture

レンタル NVIDIA L40 クラウドで

VRAM 48 GB GDDR6
帯域幅 864 GB/s
FP16 181.0 TFLOPS
FP32 90.5 TFLOPS
TDP 300W
アーキテクチャ Ada Lovelace

このGPUモデルの価格データはまだありません。近日中にご確認ください。

NVIDIA L40 技術仕様

製造元 NVIDIA
アーキテクチャ エイダ・ラブレス
VRAM 48 GB GDDR6
帯域幅 864 GB/s
FP16(テンソル) 181.0 TFLOPS
FP32 90.5 TFLOPS
TDP 300W
発売年 2023
セグメント データセンター
メモリタイプ GDDR6

最適用途

Inference video processing rendering

よくある質問

NVIDIA L40のメモリ帯域幅はLLMの実運用推論に十分ですか?

NVIDIA L40の仕様書の短縮版:48 GBのGDDR6864 GB/s、181 FP16 TFLOPS、90.5 FP32 TFLOPS、Ada Lovelace2023)、300W。

詳細版:このカードは大規模テンソルの混合精度行列乗算に最適化されており、これはトランスフォーマーのトレーニングと生産推論で求められる性能です。帯域幅はアテンション操作でのスタールを防ぐのに十分で、VRAM容量はCPUメモリへのオフロードを必要とせずに最新のモデルサイズをカバーします。

Full specs, benchmarks, and comparisons are on the NVIDIA L40 page.

NVIDIA L40 メモリボトルネック vs 計算ボトルネックのワークロード

NVIDIA L40 の性能概要:181 FP16 TFLOPS、90.5 FP32 TFLOPS、864 GB/s 帯域幅、48 GB VRAM。

実用的なベンチマークに換算すると、7BパラメータのLLMをFP16で合理的なバッチサイズでトレーニングすると、通常は帯域幅より先に計算性能が飽和します。同じモデルのリアルタイムサービングは通常帯域幅制限で、864 GB/s の数値に追随します。拡散画像生成ベンチマークは両者の中間に位置し、計算負荷の高いステップはテンソルコアをよく活用し、アテンションブロックは帯域幅にアクセスします。

Check the NVIDIA L40 page for complete specifications and related GPU matchups.

NVIDIA L40 の代替案 — 他に検討すべきものは?

NVIDIA L40は、その48 GBのVRAMとAda Lovelaceのテンソルコアがよくマッチするワークロードに最適です:Inference, video processing, rendering

もしワークロードが大幅に多くのメモリを必要とする場合(例:最先端モデルのスクラッチトレーニング)、NVIDIA L40は小さすぎて、H100/H200/B200クラスのカードが望ましいでしょう。逆に少なめのメモリで済む場合(例:7Bパラメータモデルの小規模サービング)、L4やRTX 4090などの安価なカードの方がコスト効率が良いかもしれません。中間帯では、通常NVIDIA L40が賢明な選択です。

Full specs, benchmarks, and comparisons are on the NVIDIA L40 page.

他の GPU と比較する

NVIDIA L40 が他の人気クラウド GPU とスペック、価格、可用性でどう比較されるかをご覧ください。