모델 801건 · 국산 131 · 가격 643 추적 중
AI 인프라·반도체

NVIDIA 베라 루빈 NVL72, MLPerf 추론 벤치마크 데뷔

NVIDIA Blog·2026-09-16영문 원문주요

요약

NVIDIA가 업계 표준 벤치마크인 MLPerf Inference v6.1에 베라 루빈(Vera Rubin) NVL72 시스템의 첫 프리뷰 결과를 제출했다. NVIDIA 발표에 따르면 베라 루빈 NVL72는 Qwen3-VL 처리에서 GB300 NVL72 대비 최대 3.7배, DeepSeek-R1 처리에서 최대 2.5배 높은 처리량을 기록했다. 또한 GB300 NVL72는 72개에서 288개 GPU로 랙을 확장했을 때 99%의 스케일링 효율을 보였고, 소프트웨어 최적화만으로 이전 버전(v6.0) 대비 최대 1.6배 성능이 향상됐다고 밝혔다. 이 수치들은 NVIDIA가 MLCommons가 관리하는 MLPerf에 자체 제출한 결과다.

큐레이터 노트

원문에 없는 맥락입니다

MLPerf는 여러 업체가 참여하는 표준화된 벤치마크 체계이지만, 이번 결과는 NVIDIA가 자체 측정·제출한 프리뷰 수치라는 점을 감안해서 볼 필요가 있다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

이번 발표는 9월 15~16일 NVIDIA가 AI Infra Summit을 계기로 잇달아 내놓은 베라 루빈 NVL72 관련 소식들과 이어진다. 앞서 NVIDIA는 DSX 소프트웨어와 Lambda·Emerald AI 사례를 통해 베라 루빈 NVL72의 전력 효율 개선을 강조했는데, 이번에는 같은 시스템의 순수 처리량 성능을 MLPerf라는 업계 표준 벤치마크 무대에 올려 공개했다.

짚어야 할 점

  • MLPerf는 여러 업체가 참여하는 표준 벤치마크지만, 이번 수치는 NVIDIA가 자체 측정해 제출한 '프리뷰' 결과이며 비교 대상도 자사의 이전 세대(GB300)라는 점에 유의할 필요가 있다.
  • 같은 주에 나온 DSX·AEMA 발표는 '같은 전력으로 더 많은 일을 처리한다'는 효율 프레임이었던 반면, 이번 MLPerf 결과는 절대 처리량(3.7배, 2.5배) 중심이어서 두 발표를 함께 보면 NVIDIA가 베라 루빈 세대를 성능과 효율 양쪽에서 동시에 홍보하고 있음을 알 수 있다.
  • 72개에서 288개 GPU로 확장 시 99% 스케일링 효율, 소프트웨어만으로 1.6배 향상됐다는 수치는 하드웨어 세대교체 없이도 최적화로 성능을 끌어올릴 수 있음을 보여주는 대목으로, DSX 소프트웨어 전략과 맥락이 닿아 있다.

아직 확인되지 않은 것

  • 다른 업체들이 동일한 MLPerf v6.1 라운드에서 경쟁 시스템으로 제출한 결과와 비교했을 때도 이 격차가 유지되는지는 확인되지 않았다.
  • 이번 처리량 수치가 어떤 전력 소비 조건에서 측정됐는지, 즉 DSX가 강조한 '동일 전력 예산' 하에서 나온 결과인지 별도로 밝혀지지 않았다.
  • 베라 루빈 NVL72의 실제 출하 시기나 고객 도입 일정은 이번 자료에서 언급되지 않았다.

이 기사에 나온 모델

단가는 이 사이트 카탈로그에서 매일 확인한 값입니다 · USD / 1M 토큰

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

빅밸류·노타 등 국내 AI기업 SW 성과 공개
ZDNet Korea · 2026-09-23

빅밸류는 9월 22일 국가데이터처와 간담회를 열고 'AI 레디 데이터 기반 AX' 전략과 구축·활용 노하우를 공유했다. 노타는 '휴머노이드 서밋 서울 2026'에서 자사 플랫폼 '넷츠프레소'로 퀄컴 NPU·엔비디아 GPU 환경에서 로봇 AI 모델 7종을 최적화해 추론 속도를 높인 사례를…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
처리량
처리량은 시스템이 일정 시간 동안 처리할 수 있는 요청 수나 생성 토큰 수를 나타내는 지표를 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

NVIDIA Blog 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →