NVIDIA Blackwell, 에이전틱 AI 인프라 벤치마크 AgentPerf에서 선두
NVIDIA 블로그의 「NVIDIA Blackwell, 업계 최초 에이전틱 AI 인프라 벤치마크에서 선두 기록」(2026-06-15)을 읽고 핵심만 정리했다. 앞서 다룬 SemiAnalysis AgentX 벤치마크 글과 짝을 이루는 내용으로, 이번엔 Artificial Analysis의 AgentPerf다. (이 글의 초안은 설치된 Hermes 에이전트가 작성했고, Claude가 검수 후 발행했다.)
TL;DR: 단일 LLM 호출 측정에서 벗어나 연쇄 호출·툴 사용이 반복되는 에이전틱 워크로드 전용 벤치마크 AgentPerf(Artificial Analysis)가 나왔다. GB300 NVL72는 DeepSeek V4 Pro 기준 HGX H200 대비 메가와트당 최대 20배 많은 동시 에이전트를 처리했다. 랙 스케일 NVLink, 통신-연산 중첩 커널, TensorRT-LLM의 프리필/디코드 분리 최적화가 격차를 만든다.
1. 왜 에이전트 전용 벤치마크인가
단순 챗봇은 요청 한 번에 응답 한 번이지만, 에이전틱 워크로드는 목표 분해 → 추론 → 툴 호출 → 관찰 → 재추론의 루프가 이어지는 릴레이 방식이다. AgentPerf는 실제 코딩 에이전트의 궤적(파일 읽기, 코드 수정, 명령 실행)을 그대로 본떠 설계했고, 응답성과 출력 토큰 비율(SLO)을 지키면서 동시에 굴릴 수 있는 에이전트 수를 잰다.
원문 근거
"이 데이터는 12개 이상의 프로그래밍 언어를 아우르는 실제 공개 코드 저장소에서 수집한 것으로, 긴 시퀀스 길이와 툴 호출 패턴, 지연 시간 모두 실제 코딩 워크플로를 그대로 반영합니다. AgentPerf는 플랫폼이 응답성과 출력 토큰 비율에 대해 정의된 성능 임계값을 충족하면서 동시에 지원할 수 있는 에이전틱 태스크의 수를 측정합니다."
2. 결과 — 메가와트당 20배
GB300 NVL72는 DeepSeek V4 Pro를 돌릴 때 HGX H200 시스템보다 메가와트당 최대 20배 많은 동시 에이전트를 감당했다.
원문 근거
"이 워크로드에서 NVIDIA GB300 NVL72는 벤치마크 최고 성능을 기록하며, NVIDIA HGX H200 시스템 대비 메가와트당 최대 20배 많은 에이전트를 처리했습니다. NVIDIA GB300 NVL72는 에이전트당 초당 20토큰과 60토큰, 두 가지 서비스 수준 목표(SLO) 모두에서 NVIDIA H200보다 메가와트당 훨씬 많은 동시 에이전트를 지원합니다."
격차는 세 겹에서 나온다.
- 하드웨어: GPU 72개를 NVLink로 랙 하나에 묶어 대규모 MoE 모델의 분산 실행을 효율화
- 커널: 통신과 연산을 중첩(overlap)해 전문가(expert) 간 조율 비용을 지연 없이 흡수
- 소프트웨어: TensorRT-LLM이 입력 처리(prefill)와 출력 생성(decode)을 따로 최적화해 세션이 늘어도 효율 유지
실제 적용 사례로는 Baseten, Together AI(Cursor 에이전틱 코딩 플랫폼의 실시간 추론), DeepInfra(자동차 대리점 AI 인력 플랫폼 Pam.ai)를 든다.
3. AgentX와 뭐가 다른가
같은 “에이전틱 벤치마크”지만 주체와 방법이 다르다. AgentX(SemiAnalysis)는 미리 녹화해둔 Claude Code 세션을 턴 단위로 재현하고, AgentPerf(Artificial Analysis)는 코딩 에이전트 궤적을 놓고 SLO를 충족하는 동시 에이전트 수를 센다. 그래도 결론은 한곳으로 모인다 — 에이전트 시대의 인프라 지표는 절대 처리량이 아니라 전력당 동시 에이전트 수다.
4. 읽으면서 든 생각
- 에이전트 시스템에서 중요한 건 단건 응답 속도가 아니라, 툴 호출 루프가 반복될 때 시스템 전체가 내는 처리량과 전력 효율이다.
- 다만 원문도 벤치마크의 한계를 짚는다. AgentPerf는 툴 호출 시간을 실제로 실행하지 않고 대표적인 CPU 처리 시간으로 시뮬레이션한다. 실환경에서는 외부 API 지연이나 DB 쿼리 같은 외부 I/O가 먼저 병목이 되기 쉬우니, 이 수치를 그대로 용량 계획에 옮기면 곤란하다.
원문 근거
"툴 호출은 실제로 실행되지 않고 대표적인 CPU 처리 시간으로 시뮬레이션되므로, 결과의 차이는 가속 컴퓨팅 성능만을 반영합니다."
- 전력 효율이 20배라 해도 GB300 NVL72의 도입 비용과 MW 단위 전력 요구는 그대로 남는다. 예상 동시 에이전트 수를 기준으로 TCO부터 따져봐야 한다.
참고
관련글 목록
- RAG & AI 에이전트 주간 연구 동향 (2026-08-31 ~ 09-06)
- Talkie — 1931년 이전 텍스트만으로 학습한 13B 빈티지 언어모델
- RAG & AI 에이전트 주간 연구 동향 (2026-08-23 ~ 08-30)
- RAG & AI 에이전트 주간 연구 동향 (2026-08-17 ~ 08-23)
- RAG & AI 에이전트 주간 연구 동향 (2026-08-10 ~ 08-16)
- RAG & AI 에이전트 주간 연구 동향 (2026-08-03 ~ 08-09)
- Prompt Caching 실전 가이드 — 원리·프롬프트 설계·프로바이더별 차이·운영 팁
- RAG & AI 에이전트 주간 연구 동향 (2026-07-27 ~ 08-02)
- 오케스트레이션이란 무엇인가 — 루프에서 그래프로, 에이전트 협업의 구조 이해하기
- 시맨틱 하이라이트란? — RAG 초보자를 위한 5분 요약
- RAG의 숨은 병목 — 시맨틱 하이라이트(의미 강조)로 검색과 설명의 불일치 해결
- 에이전트는 어떻게 '배우고' 고치는가 — 기억·스킬·피드백 루프의 실제 구조
- Hermes 파이프라인에 OKF 지식 번들 올리기
- Hermes Agent 설치부터 설정까지 - Windows에서 시작하기
- 오픈소스 가드레일 모델과 온프레미스 에이전트 파이프라인 구성
- 구글 OKF(Open Knowledge Format)는 RAG를 대체하나?
- Claude Code로 제안서 작성 파이프라인 만들기
- RAG & AI 에이전트 주간 연구 동향 (2026-07-12 ~ 07-19)
- 나디르 위성영상 캡셔닝을 위한 오픈웨이트 멀티모달 모델 비교
- 위성 영상 처리: 멀티모달 LLM vs 이미지 임베딩 모델
- Caller/Executor 패턴으로 멀티 에이전트 구성하기
- OpenRouter 무료 모델을 API로 사용하기
- PaperBanana - 문장으로 아키텍처 다이어그램 그리기
- AI TOOLS