HBM을 읽을 때, 용량과 대역폭을 나눠 보는 이유
GB는 담을 수 있는 양이고, TB/s는 옮기는 속도입니다. AI 반도체의 메모리 사양을 비교할 때 먼저 맞춰야 할 기준을 정리합니다.
HBM 사양에 GB와 TB/s가 함께 나오지만, 두 숫자는 같은 성능을 다른 단위로 표현한 것이 아닙니다. 용량은 데이터를 얼마나 담는지, 대역폭은 단위 시간에 얼마나 옮기는지를 뜻합니다.
AI 반도체를 비교할 때 이 구분을 놓치면 “메모리가 더 크니 무조건 더 빠르다”는 결론으로 건너뛰기 쉽습니다. 무엇을 담아야 하는지와 무엇을 얼마나 자주 읽어야 하는지를 따로 봐야 합니다.
HBM은 데이터를 가까이, 넓게 옮기는 구조
Micron은 HBM을 DRAM 다이를 수직으로 쌓고 TSV 등의 연결로 넓은 인터페이스를 만드는 메모리 구조로 설명합니다. 패키지 안에서 프로세서 가까이에 배치하는 것도 특징입니다. 용량과 함께 데이터 이동 능력이 중요한 제품이라는 뜻입니다.
LLM을 GPU에서 실행할 때는 모델의 가중치와 KV 캐시 등이 메모리를 차지합니다. NVIDIA의 추론 설명은 모델 가중치와 KV 캐시를 주요 메모리 요구 요소로 구분합니다. 단순히 모델 파일이 들어갈 공간만 확인하면 동시 요청과 문맥 길이에 따른 메모리 사용을 놓칠 수 있습니다.
가상의 두 메모리를 비교해 보기
구분을 위한 예를 만들어 보겠습니다. 제품 A는 용량 80GB, 대역폭 2TB/s이고 제품 B는 용량 40GB, 대역폭 3TB/s라고 가정합니다. 실제 제품의 사양이나 벤치마크가 아닙니다.
| 비교하는 조건 | 먼저 확인할 항목 | 이 예에서 알 수 있는 것 |
|---|---|---|
| 필요한 데이터가 60GB | 용량 | A에는 들어가지만 B 하나에는 들어가지 않음 |
| 이미 들어간 데이터를 읽는 작업 | 대역폭과 실제 접근 방식 | B의 표기 대역폭이 높음 |
| 서비스 전체의 응답 속도 | 연산·메모리·통신·소프트웨어 | 이 두 사양만으로 우열을 확정할 수 없음 |
필요한 데이터가 장치 하나에 들어가지 않으면 여러 장치로 나누는 등의 구성이 필요할 수 있습니다. 반대로 데이터가 들어간 뒤에도 메모리에서 충분히 빨리 공급하지 못하면 연산 자원의 활용이 제한됩니다. 같은 “메모리 문제”라도 해결하려는 조건이 다릅니다.
스택 하나와 가속기 전체를 섞지 않기
기사의 숫자가 HBM 스택 하나 기준인지, 여러 스택이 붙은 가속기 전체 기준인지를 먼저 확인해야 합니다. 서로 다른 범위의 숫자를 나란히 놓으면 제품 세대의 변화보다 비교 단위의 차이가 더 크게 보일 수 있습니다.
제조사끼리 전력 효율을 비교할 때도 조건이 중요합니다. 용량, 스택 높이, 동작 조건과 비교 대상을 확인해야 하며, 제조사가 공개한 개선율을 모든 워크로드의 성능 향상률로 바꾸어 읽어서는 안 됩니다.
사양에서 실적으로 넘어갈 때 남는 질문
이 글의 해석은 사양의 개선과 사업 성과를 한 단계씩 연결해서 보자는 것입니다. 대역폭이 높아졌다는 발표는 기술 사양에 대한 정보입니다. 실제 매출과 이익을 보려면 고객 채택, 출하, 가격, 비용에 대한 자료가 더 필요합니다.
다음 HBM 발표에서는 숫자 옆에 세 가지를 적어두면 비교가 쉬워집니다. 용량인지 대역폭인지, 스택 기준인지 시스템 기준인지, 제조사 설명인지 실제 서비스 측정인지입니다.
확인한 자료
핀포스트 · 공시와 기술 문서를 읽고 정리합니다.