top of page

Hot Chips 2026이 보여준 AI 인프라의 진화 방향

Chang Sun Park
2일 전
5분 분량

2026년 8월 23일부터 25일까지 Hot Chips 2026이 열렸습니다. 이번 행사는 AI 인프라의 주요 관심사가 어디로 이동했는지를 잘 보여주는 자리였습니다. 올 해에도 다양한 주제가 논의되었습니다. HBM과 3D DRAM, HBF, PIM 같은 메모리 기술부터 CPU, GPU, 네트워크와 인터커넥트, 하이퍼스케일러의 맞춤형 AI 가속기, 랙스케일 시스템 등 다양한 이야기가 오갔는데요. 모든 주제를 관통하는 메시지가 있었습니다. AI 시스템의 경쟁 단위가 하나의 칩에서 데이터 이동 경로와 메모리, 네트워크, 소프트웨어를 함께 설계한 시스템으로 바뀌고 있다는 것이었습니다. 관련해 이번 포스팅에서는 Hot Chips 2026을 통해 알 수 있었던 AI 인프라 담당자가 알아야 할 주요 트렌드를 정리해 보겠습니다.

 


Trends 1: 연산보다 중요한 데이터 이동

AI 가속기의 연산 성능은 빠르게 높아지고 있습니다. 반면에 메모리 용량과 대역폭, 칩 사이의 연결 속도는 성능 개선에 비례해 늘지 않죠. AI 가속기가 데이터를 기다리면 성능이 실제 처리량으로 이어지지 않습니다.

이 문제는 추론에서 더 선명하게 나타납니다. 입력 문맥을 한 번에 처리하는 프리필(Prefill)은 연산량의 영향을 많이 받습니다. 반면 토큰을 하나씩 생성하는 디코드(Decode)는 모델 가중치와 KV 캐시를 반복해서 읽어 메모리 용량과 대역폭 영향을 크게 받습니다. 긴 문맥과 여러 에이전트를 동시에 운영할수록 메모리와 데이터 이동이 토큰 생산 비용을 결정합니다.


Hot Chips 2026에서 여러 기업들이 연산을 데이터 가까이 옮기는 방식이 필요하다고 한 목소리를 낸 이유입니다. 좀 더 자세히 보자면 삼성전자는 HBM 베이스 다이에 논리 기능을 추가하는 방향을, d-Matrix는 DRAM 위에 연산을 적층하는 3D DRAM을, 삼성전자의 LPDDR5X-PIM은 메모리 뱅크 가까이에서 일부 추론 연산을 처리하는 방식을 소개했습니다. XCENA는 CXL 연산 메모리느인 MX1을 공개하며 확장 메모리 내부에서 데이터를 줄인 뒤 결과만 호스트로 보내는 접근을 제시했습니다. 두 기업의 기술 구현 방식은 다르지만 메시지는 같습니다. 더 많은 데이터를 더 빠르게 옮기는 것만으로는 한계가 있어 이동해야 할 데이터 자체를 줄여야 한다는 것입니다.

 

Trends 2: 이기종 아키텍처

AI 워크로드는 학습과 프리필, 디코드, 검색, 데이터 전처리, 네트워크 통신, 에이전트의 도구 실행 등 다양합니다. 유형에 따라 요구하는 연산 형태와 메모리, 지연시간도 다릅니다. 따라서 모든 작업을 범용 GPU로만 처리하면 전력과 비용 효율을 모든 워크로드에서 최적의 상태로 유지하기 어렵습니다.


AI 가속기 업계는 이 문제 해결의 열쇠를 역할 분담에서 찾고 있습니다. 하나의 가속기가 모든 작업을 처리하도록 설계하기보다 학습과 추론은 물론 프리필과 디코드처럼 특성이 다른 작업까지 구분하고 각 작업에 적합한 프로세서를 배치하는 것입니다. 이처럼 워크로드의 특성에 따라 연산 자원의 역할을 나누고 이를 하나의 시스템으로 결합하는 접근을 이기종 컴퓨팅(Heterogeneous Computing)이라고 하죠. 이기종 컴퓨팅의 핵심은 단순히 여러 종류의 가속기를 도입하는 데 있지 않습니다. 워크로드를 단계별로 구분하고 각 단계에 적합한 CPU·GPU·LPU·DPU·맞춤형 가속기와 메모리를 배치한 뒤 이들을 하나의 시스템처럼 유기적으로 운영하는 것이 중요합니다.


그렇다면 이번 행사에서 주요 플레이어들은 어떤 소식을 전했을까요? 엔비디아는 Rubin GPU와 함께 에이전틱 AI의 저지연 토큰 생성을 위한 Groq 3 LPX를 소개했습니다. 인텔은 범용 오케스트레이션을 담당하는 Diamond Rapids CPU와 추론 경제성을 겨냥한 Crescent Island GPU를 함께 제시했습니다. Crescent Island는 최대 480GB LPDDR5X를 탑재한 350W 공랭식 PCIe 카드로 설계해 기존 데이터센터에서도 효율적으로 추론 환경을 구축할 수 있도록 했습니다. 구글은 8세대 TPU 제품군을 학습용TPU 8t와 추론용 TPU 8i로 구분하고 추론용 제품의 메모리와 SRAM 구성을 서빙 특성에 맞게 최적화했습니다. Cerebras와SambaNova, Groq각사의 AI 가속기 아키텍처를 소개하며 대용량 온칩 메모리와 데이터플로 기반 설계가 디코드 단계의 지연시간을 줄이고 예측 가능성을 높일 수 있다는 점을 강조했습니다.

 

Trends 3: 높아진 CPU의 존재감

그동안 AI 분야의 스포트라이트는 AI 가속기에 맞추어져 있었습니다. 그러던 것이 에이전틱 AI 시대가 되면서 CPU의 존재감이 커지는 분위기입니다. 에이전트는 한 번의 모델 호출로 작업을 끝내지 않습니다. 모델이 판단하고, 검색이나 코드 실행 같은 도구를 호출하고, 결과를 정리한 뒤 다시 모델을 호출합니다. 이 과정에서 운영체제와 네트워크, 데이터베이스, 보안 검사, 요청 스케줄링을 담당하는 CPU가 매 단계의 경로에 놓입니다. GPU가 토큰을 빠르게 생성하더라도 CPU의 단일 스레드 지연과 메모리 접근, I/O 처리가 느리면 사용자가 느끼는 전체 응답시간은 줄지 않습니다.


NVIDIA Vera CPU가 높은 단일 스레드 성능과 GPU 연결을 강조하고 Intel Diamond Rapids가 최대 256개 코어와 16개 메모리 채널, PCIe 6.0 및 CXL 3.0 연결을 제시한 것도 같은 맥락에서 이해할 수 있습니다. Arm과 Fujitsu 역시 높은 메모리 대역폭과 칩렛, 전력 효율을 중심으로 AI 데이터센터용 CPU가 나아갈 방향을 제시했습니다.

 

Trends 4: 진화를 멈추지 않는 메모리

AI 메모리 혁신의 중심에는 HBM이 있다는 것에 이견을 달 이는 없을 것입니다. HBM은 넓은 인터페이스를 바탕으로 GPU에 높은 대역폭을 제공하며 AI 학습과 추론 성능을 끌어올렸습니다. 하지만 모델의 규모가 커지고 추론 워크로드가 다양해지면서 대역폭만으로는 모든 요구를 충족하기 어려워지고 있습니다. HBM은 적층과 첨단 패키징이 필요해 용량과 발열, 비용 측면에서 제약이 있기 때문입니다. 관련해 Hot Chips 2026에서는 HBM 자체의 성능을 높이는 동시에 용량과 비용 특성이 다른 메모리를 적재적소에 활용하려는 업계의 움직임도 확인할 수 있었습니다.


HBF(High Bandwidth Flash)는 이러한 변화의 대표적인 사례입니다. HBF는 NAND를 적층해 HBM보다 큰 메모리 용량을 제공하는 데 초점을 맞춥니다. 대역폭과 지연시간에서는 HBM보다 불리하기 때문에 모든 AI 워크로드를 위한 대체재로 보기는 어렵습니다. 다만 대역폭보다 모델을 메모리에 충분히 담는 것이 중요한 프라이빗 AI나 대규모 MoE 모델에서는 새로운 선택지가 될 수 있습니다. 모델 가중치와 전문가 데이터를 가속기 가까이에 배치하면 필요한 GPU 수와 칩 간 데이터 이동을 줄일 가능성이 있기 때문입니다.


CXL 기반 확장 메모리도 주목할 만합니다. CXL을 활용하면 여러 프로세서가 메모리를 유연하게 공유하고 필요에 따라 용량을 확장할 수 있습니다. 여기에 메모리 인접 연산 기능을 결합하면 원시 데이터를 모두 호스트 프로세서로 옮기지 않고 메모리 가까이에서 일부 작업을 처리한 뒤 필요한 결과만 전달할 수도 있습니다. 이제 AI 시스템의 메모리 경쟁력은 얼마나 많은 메모리를 장착했는지만으로 결정되지 않습니다. 워크로드의 특성에 따라 HBM과 HBF, CXL 메모리를 어느 계층에 배치하고 데이터 이동과 연산을 어떻게 조율할 것인지가 전체 시스템의 성능과 경제성을 좌우할 것으로 보입니다.

 

Trends 5: 랙 스케일 아키텍처

그동안 AI 인프라의 성능은 주로 개별 가속기의 연산량을 중심으로 평가했습니다. 하지만 칩 하나의 성능이 높아져도 전력과 냉각, 메모리, 네트워크가 이를 뒷받침하지 못하면 실제 토큰 처리량은 늘어나지 않습니다. 반대로 개별 칩의 최고 성능이 다소 낮더라도 랙 전체에서 높은 가동률과 예측 가능한 지연시간, 낮은 전력 소비를 유지한다면 더 나은 경제성을 확보할 수 있습니다. AI 시스템의 경쟁 기준이 칩의 최고 성능에서 랙 전체의 효율로 확장되고 있는 것입니다.


Hot Chips 2026에서는 이러한 변화를 보여주는 발표가 이어졌습니다. Cerebras는 웨이퍼 스케일 엔진을 랙 단위로 확장하는 구조를 소개했고, Microsoft는 MAIA 200을 데이터센터 규모의 AI 시스템으로 제시했습니다. NVIDIA는 Rubin GPU와 Vera CPU, LPX, BlueField-4, Spectrum-X 네트워크를 하나의 플랫폼으로 연결하며 컴퓨팅과 네트워크, 데이터 처리를 함께 최적화하는 방향을 강조했습니다. AMD도 MI400 GPU의 칩 아키텍처와 함께 이를 실제 인프라로 구현하기 위한 시스템 아키텍처를 별도의 세션에서 다뤘습니다.


이제 랙 스케일 시스템의 성능은 개별 가속기의 최대 연산량만으로 평가하기 어렵습니다. 랙당 토큰 처리량과 토큰당 비용·전력, 가속기 가동률은 물론 장애가 미치는 범위와 시스템 확장에 필요한 시간까지 함께 살펴야 합니다. 토큰 경제 시대에는 가장 빠른 칩을 보유했는가보다 투자한 인프라에서 얼마나 많은 유효 작업을 안정적이고 경제적으로 처리할 수 있는가가 더 중요한 경쟁력이 됩니다.

 

AI 인프라 담당자는 무엇을 준비해야 할까?

그렇다면 Hot Chips 2026에서 감지할 수 있는 다양한 변화를 AI 인프라 담당자는 조직의 AI 전략에 어떻게 반영해야 할까요? 이번 행사를 통해 확인한 트렌드를 다음과 같이 다섯 가지 관점에서 살펴 전략에 반영해야 할 것입니다.


  1. 학습과 추론을 같은 기준으로 설계해서는 안 됩니다. 학습에서는 대규모 병렬 연산과 가속기 간 집단 통신이 중요하지만 추론에서는 프리필과 디코드의 특성, 지연시간과 처리량의 균형을 함께 고려해야 합니다. 워크로드를 단계별로 세분화해야 각 작업에 적합한 xPU와 메모리 구성을 선택할 수 있습니다.

  2. 서버 사양서 밖에서 발생하는 병목까지 살펴야 합니다. 스토리지에서 GPU 메모리로 데이터가 이동하는 경로, GPU 사이의 스케일업 연결, 랙 사이의 스케일아웃 네트워크, CPU와 DPU가 담당하는 작업을 하나의 데이터 흐름으로 검토해야 합니다. 개별 구성 요소의 성능이 높더라도 이 경로가 원활하지 않으면 전체 시스템의 처리량은 늘어나지 않습니다.

  3. PoC 단계부터 시스템 경제성을 평가해야 합니다. 모델 정확도와 단일 요청의 지연시간만 확인해서는 실제 운영 비용을 판단하기 어렵습니다. 가속기 가동률과 초당 토큰 수, 토큰당 전력과 비용, 데이터 준비 시간, 장애 복구 시간까지 함께 측정해야 운영 환경에 맞는 선택 기준을 마련할 수 있습니다.

  4. 메모리와 데이터 계층을 함께 설계해야 합니다. 긴 문맥과 KV 캐시를 모두 GPU 메모리에 저장하는 방식은 비용과 용량 측면에서 한계가 있습니다. 시스템 메모리와 로컬 NVMe, 고성능 공유 스토리지를 연결하고 데이터의 사용 빈도와 재사용 가능성에 따라 적절한 계층에 배치하는 방안을 검토해야 합니다.

  5. 랙 단위의 전력과 냉각 계획을 인프라 로드맵에 포함해야 합니다. 차세대 가속기나 랙 스케일 시스템을 선택한 뒤 시설 요건을 검토하면 전력 증설과 냉각 설비 구축 때문에 실제 가동 시점이 늦어질 수 있습니다. 모델과 가속기를 선정하는 단계부터 랙 밀도와 전력 공급 방식, 수랭 전환 여부와 준비 기간을 함께 계산해야 합니다.


대원씨티에스는 서버와xPU, AI네트워크,데이터 플랫폼을 아우르는 파트너 생태계를 바탕으로 고객의 학습·추론 워크로드에 적합한 랙 스케일 아키텍처를 제안합니다. Hot Chips 2026에서 확인한 변화가 현재의AI인프라 로드맵에 어떤 영향을 미치는지 점검하고 싶다면 대원씨티에스로 문의 바랍니다.

댓글

별점 5점 중 0점을 주었습니다.
등록된 평점 없음

평점 추가
bottom of page