NVIDIA GeForce RTX 3080 เร็วกว่ารุ่น A100 สำหรับการปรับแต่งละเอียดหรือไม่?
คำตอบ
การคำนวณดิบบน NVIDIA GeForce RTX 3080 สูงสุดที่ 29.8 FP16 TFLOPS และ 14.9 FP32 TFLOPS พร้อมแบนด์วิดท์หน่วยความจำ 760 GB/s ที่จ่ายให้หน่วยคำนวณ สถาปัตยกรรม Ampere นำ tensor cores ที่ปรับแต่งสำหรับ BF16/FP16 / FP8 ความแม่นยำผสม — รูปแบบที่สำคัญที่สุดสำหรับทรานส์ฟอร์เมอร์สมัยใหม่
อัตราการประมวลผลโมเดลในโลกจริงขยายตัวใกล้เคียงกับค่าสูงสุดทางทฤษฎีที่ขนาดแบตช์ใหญ่; แบตช์เล็กกว่าจะถูกจำกัดด้วยหน่วยความจำ สำหรับการอนุมานที่มีความหน่วงต่ำ โทเค็นต่อวินาทีบนทรานส์ฟอร์เมอร์เช่น Llama 70B ขึ้นอยู่กับกลยุทธ์ควอนไทเซชันอย่างมาก — FP8/INT8 ปลดล็อกเพดานการคำนวณ, FP16 ถูกจำกัดด้วยแบนด์วิดท์
The NVIDIA GeForce RTX 3080 page has the complete datasheet and side-by-side comparisons.