#ai기술동향#AI기업동향#AI모델출시#AI시장#AI업계동향#구글ai#앤트로픽#오픈AI

NVIDIA Rubin CPX 2026년 말 출시, 100TB 메모리로 '백만 토큰 추론'을 겨냥한 이유

16분 소요
NVIDIA Rubin CPX 2026년 말 출시, 100TB 메모리로 '백만 토큰 추론'을 겨냥한 이유

NVIDIA가 2025년 9월 9일 공개한 Rubin CPX는 '대규모 컨텍스트 추론'에 특화한 GPU(Graphics Processing Unit, 병렬 연산 처리장치)다.

목표 작업은 백만 토큰 규모의 소프트웨어 코딩과 생성형 비디오다.

여기서 토큰(Token, AI가 문장을 처리하는 최소 단위)이 백만 개라는 말은 단순히 긴 질문을 받는다는 뜻이 아니다.

거대한 코드베이스, 문서, 작업 이력이나 장시간 영상의 앞뒤 관계를 한 번에 참고하며 다음 결과를 생성한다는 의미다.

제목의 '2026년 말 출시'는 이미 판매되거나 대규모 배치됐다는 뜻이 아니라 NVIDIA가 제시한 가용 예정 시점을 가리킨다.

공식 발표에 기재된 일정은 2026년 말이며, 제품 기능과 일정은 변경될 수 있다. 더 중요한 구분은 100TB가 Rubin CPX GPU 한 개의 메모리가 아니라는 점이다.

NVIDIA 발표 기준 'Vera Rubin NVL144 CPX 단일 랙' 전체가 100TB 고속 메모리와 8엑사플롭스의 AI 성능을 제공한다.

백만 토큰에서 커지는 KV 캐시

장문맥(Long Context, 매우 긴 입력과 대화 이력을 함께 처리하는 방식) 추론에서는 모델이 읽은 내용을 계속 다시 계산하지 않도록 KV 캐시(Key-Value Cache, 이전 토큰의 어텐션 중간 계산값을 저장하는 공간)를 쓴다.

도서관 사서가 책을 읽을 때마다 앞장을 처음부터 펼치는 대신 핵심 색인을 옆에 쌓아 두는 것과 비슷하다.

토큰이 길어질수록 이 색인이 커지므로, 저장 공간인 메모리 용량과 필요한 값을 제때 공급하는 메모리 대역폭(Memory Bandwidth, 초당 전송 가능한 데이터량)이 함께 중요해진다.

용량이 부족하면 필요한 중간값을 같은 위치에 유지하기 어렵고, 대역폭이 부족하면 연산기가 빨라도 데이터가 도착할 때까지 기다린다.

GPU 사이에서 캐시와 모델 상태를 옮기는 데이터 이동도 지연시간과 전력 부담을 키운다.

따라서 백만 토큰 추론은 연산량만 늘리는 문제가 아니라 '저장하고, 꺼내고, 연결하는' 전체 경로를 동시에 설계하는 문제다.

생성형 비디오는 영상 한 시간의 처리가 최대 백만 토큰에 이를 수 있으며, NVIDIA는 Rubin CPX에 비디오 인코더와 디코더, 장문맥 추론 처리를 통합했다고 설명했다.

칩과 랙을 나눠 봐야 하는 이유

Rubin CPX는 개별 연산용 GPU이고 Vera Rubin NVL144 CPX는 이 GPU를 Vera CPU 및 Rubin GPU와 결합한 랙 스케일(Rack Scale, 서버 랙 전체를 하나의 시스템처럼 구성하는 방식) 플랫폼이다.

개별 Rubin CPX GPU 사양은 128GB GDDR7 메모리와 NVFP4 정밀도 기준 최대 30페타플롭스로 제시됐다.

반면 100TB와 8엑사플롭스는 Vera Rubin NVL144 CPX 단일 랙에 귀속되는 수치다.

칩 사양과 랙 사양을 섞으면 실제 구매 단위와 인프라 요구량을 크게 오해하게 된다.

Vera Rubin NVL144 CPX 단일 랙의 100TB 메모리 설계는 거대한 모델 상태와 KV 캐시를 담는 '작업대의 크기'를 뜻하고, 같은 랙의 8엑사플롭스 AI 성능은 그 작업을 수행하는 '계산 자원'을 뜻한다.

다만 8엑사플롭스는 NVIDIA가 표기한 AI 성능 수치이며, 정밀도와 구체적인 측정 조건을 떠나 모든 연산의 보편적 속도로 해석해서는 안 된다.

실무자는 용량과 계산량 외에도 메모리 대역폭, 노드 간 통신, 서비스 지연시간을 함께 봐야 한다.

코딩과 영상 기업이 보는 가능성

코딩 에이전트는 여러 저장소와 문서, 수정 이력을 오래 유지할수록 프로젝트 전체의 의존관계를 다루기 쉬워진다.

생성형 비디오는 프레임 사이 인물과 배경의 일관성을 유지하면서 긴 시퀀스를 처리해야 한다.

서로 다른 서비스처럼 보이지만, 긴 컨텍스트를 저장하고 빠르게 다시 참조해야 한다는 인프라 요구는 닮아 있다.

이것이 Rubin CPX가 코딩과 비디오를 하나의 목표 워크로드로 묶은 이유다.

NVIDIA 발표에는 Cursor, Runway, Magic이 Rubin CPX가 각사 응용을 어떻게 가속할 수 있는지 살펴보는 기업으로 언급됐다.

이는 수요 방향을 보여주는 신호이지만 구매 계약, 도입 완료, 독립 성능 검증을 의미하지 않는다.

특히 Magic은 1억 토큰 컨텍스트 윈도에서 코드베이스와 장기간 상호작용 이력, 문서와 라이브러리를 함께 볼 수 있다고 설명했다.

여기서 읽어야 할 핵심은 특정 고객의 성공 사례가 아니라 모델의 문맥 길이가 커질수록 GPU 단품보다 랙 전체의 메모리·네트워크 설계가 중요해진다는 점이다.

도입 판단을 가르는 네 가지 항목

기업이 2026년 말 일정을 준비 시점으로 삼는다면 '가용 예정'과 '운영 검증'을 분리해야 한다.

우선 실제 공급 일정과 구성 옵션을 확인하고, 자사 모델의 입력 길이와 동시 사용자 수를 반영한 실측 처리량(Throughput, 단위 시간당 처리량)과 응답 지연시간을 측정해야 한다.

이어 랙 전력, 냉각, 네트워크 증설비까지 포함한 총소유비용(TCO, 구매부터 운영까지의 전체 비용)을 계산해야 한다.

마지막으로 같은 예산에서 짧은 요청을 많이 처리할지, 긴 컨텍스트 요청을 안정적으로 처리할지 서비스 목표를 정해야 한다.

NVIDIA는 Vera Rubin NVL144 CPX에 1억 달러를 투자할 때 50억 달러의 토큰 매출을 만들 수 있다는 모델링 수치를 제시했다.

그러나 이는 가동률, 토큰 가격, 전력비, 감가상각 같은 조건에 따라 달라지는 공급사 추정이며 실현된 고객 매출이나 보장 수익이 아니다.

투자 판단에서는 발표 수치를 그대로 수익률로 바꾸기보다 자사 요청당 원가, 실제 이용률, 장애 대비 용량을 넣어 손익분기점을 다시 계산해야 한다.

Rubin CPX의 핵심은 '더 빠른 GPU'라는 한 문장보다 명확하다.

백만 토큰 코딩과 생성형 비디오에서 커지는 KV 캐시, 메모리 대역폭, 데이터 이동 병목을 칩과 랙을 함께 설계해 다루려는 시도다.

100TB와 8엑사플롭스는 Vera Rubin NVL144 CPX 단일 랙의 서로 다른 자원이며, 2026년 말은 성능 우위가 확정되는 날이 아니라 실제 처리량·전력·비용을 검증할 출발점으로 읽는 편이 정확하다.