RAISE SUMMIT 2026을 통해 본 에이전틱 AI 시대를 위한 인프라 전략
- Chang Sun Park
- 8월 25일
- 5분 분량
AI 산업의 다음 흐름은 어떻게 파악하시나요? 여러 방법이 있지만 아마 많은 분들이 AI 업계의 유명인들이 연사로 나서 다양한 세션을 진행하는 글로벌 행사를 주목할 것입니다. 관련해 이번 포스팅에서는 2026년 AI 인프라 부분에서 어떤 화두가 모두의 관심사인지 RAISE Summit 2026의 주요 의제와 발표 내용을 참조해 살펴보겠습니다.

RAISE Summit은 AI 기술과 산업, 투자와 정책의 흐름을 함께 확인할 수 있는 글로벌 행사입니다. 2026년 행사는 7월 8일과 9일 프랑스 파리 루브르 카루젤에서 열렸습니다. 약 9,000명이 참석했고 Yann LeCun과 구글의 Amin Vahdat, Pat Gelsinger를 비롯한 업계 리더가 연단에 올랐습니다. 기조연설과 패널, 비공개 세션, 스타트업 프로그램을 통해 AI를 실제 산업에 적용하는 과정에서 나타난 과제를 폭넓게 다뤘습니다.
행사 전체가 다양한 AI 의제를 다뤘다면 인프라 관련 발표와 현장 논의에서는 추론과 에이전틱 AI가 부각됐습니다. 이는 기업의 관심이 더 큰 모델을 학습하는 단계에서 AI 서비스를 안정적인 비용과 속도로 운영하는 단계로 이동하고 있다는 신호라 볼 수 있습니다. 스토리지와 네트워크, 메모리, 전력과 토큰당 비용이 함께 논의된 것도 같은 맥락입니다.
행사 현장에서 반복해서 등장한 질문은 세 가지였습니다. 추론 비용을 어떻게 낮출 것인가, 에이전트의 긴 작업 경로를 어떻게 안정적으로 운영할 것인가, 가속기 밖에서 발생하는 병목을 어떻게 찾을 것인가입니다. 세 질문은 하나의 결론으로 모였습니다. 추론 시대의 경쟁력은 칩 하나가 아니라 전체 인프라의 효율에서 결정된다는 점입니다.
RAISE Summit 2026을 관통한 키워드 ‘추론 & 에이전틱 AI’
RAISE Summit 2026에서 확인할 수 있었던 첫 번째 변화는 AI 인프라의 중심이 학습에서 추론으로 이동하고 있다는 점입니다. 그동안 대규모 AI 인프라는 더 큰 모델을 더 빨리 만드는 방향으로 발전했습니다. 학습은 반복적인 연산과 집합 통신이 많아 추론보다 자원 사용과 통신 패턴을 예측하기 쉽습니다.
추론은 완성된 모델을 실제 서비스와 업무에 적용해 사용자의 요청을 처리하는 과정입니다. 요청이 언제, 어떤 길이로 들어올지 미리 알기 어렵습니다. 여러 사용자가 서로 다른 요청을 동시에 보냅니다. 서비스가 복잡해질수록 모델 밖에서 처리해야 할 작업도 늘어납니다.
특히 AI 에이전트는 모델 호출과 검색, 도구 실행, 검증을 여러 차례 반복합니다. 단일 모델을 한 번 호출하는 서비스보다 요청 경로가 길고 변동성이 큽니다. 안정적인 운영을 위해 하드웨어와 소프트웨어를 함께 설계하고 관측하는 역량이 필요합니다.
학습과 추론은 경제성을 판단하는 기준도 다릅니다. 학습에서는 대규모 작업을 얼마나 빨리 끝내는지가 중요합니다. 추론에서는 요청 한 건과 토큰 하나를 얼마에 처리하는지, 사용자가 얼마나 기다리는지까지 따져야 합니다.
결국 추론 인프라의 핵심은 최대 성능 하나가 아닙니다. 서비스마다 다른 응답 속도와 처리량, 비용 목표를 동시에 관리하는 데 있습니다. 추론 워크로드를 유형별로 나눠 살펴봐야 하는 이유입니다.
워크로드 유형에 따라 달라지는 목표
추론은 하나의 유형으로 특정하기 어려운 워크로드입니다. 야간에 문서 수백만 건을 분류하는 업무는 개별 요청의 응답 속도보다 정해진 시간 안에 얼마나 많은 작업을 끝내는지가 중요합니다. 요청을 모아 한꺼번에 처리하면 장비당 처리량을 높이고 토큰당 비용을 낮출 수 있습니다.
고객 상담 AI 챗봇은 다른 기준이 필요합니다. 사용자는 질문을 보낸 뒤 첫 답변이 늦으면 지연을 바로 체감합니다. 답변이 시작된 뒤에도 토큰을 충분히 빠르게 생성해야 자연스럽게 대화할 수 있습니다. 이 환경에서는 최대 처리량보다 첫 토큰 응답 시간(TTFT, Time to First Token)과 사용자당 생성 속도가 더 중요합니다.
AI 에이전트는 한 단계 더 복잡합니다. 검색과 도구 실행 사이에 여러 차례 모델을 호출하므로 한 단계의 지연이 전체 작업 시간으로 이어질 수 있습니다. 동일한 처리량을 확보하더라도 요청 경로와 동시 작업 수에 따라 사용자가 체감하는 성능은 달라집니다.
워크로드별로 핵심 관리 지표가 달라지는 만큼 서비스 수준 목표(SLO, Service Level Objective)를 먼저 정해야 합니다. 입력과 출력 길이, 동시 요청 수, 허용할 수 있는 TTFT와 생성 속도, 전력 한도와 토큰당 비용을 함께 살펴야 합니다. 요청 스케줄링과 캐시 관리, 관측성, 장애 대응 체계도 갖춰야 합니다.

추론 성능은 칩이 아니라 전체 경로에서 결정
추론 요청 하나가 처리되는 과정을 살펴보면 여러 계층이 등장합니다. 사용자의 요청은 네트워크를 거쳐 서버에 도착합니다. CPU는 요청을 전처리하고 에이전트와 도구 실행을 조율합니다. 가속기는 모델을 실행합니다. 아키텍처에 따라 모델 가중치와 KV 캐시는 HBM과 호스트 메모리, NVMe와 공유 스토리지에 배치되거나 계층 사이를 이동할 수 있습니다.
어느 한 계층만 느려도 전체 응답이 늦어집니다. 같은 GPU를 사용해도 병렬화와 요청 스케줄링, 메모리 할당 방식에 따라 결과가 달라집니다. 가속기 사양만 비교해서는 실제 서비스의 성능을 예측하기 어려운 이유입니다.
대규모 언어 모델의 추론은 프리필(Prefill)과 디코드(Decode)로 나눌 수 있습니다. 프리필은 질문과 검색 문서, 대화 이력을 한꺼번에 처리하므로 연산 성능의 영향을 크게 받습니다. 디코드는 앞서 처리한 맥락을 참조해 토큰을 하나씩 만듭니다. 모델 가중치와 KV 캐시에 반복해서 접근하므로 메모리 용량과 대역폭이 중요합니다.
두 단계를 같은 방식으로 처리하면 한쪽 자원이 남는 동안 다른 쪽에서 병목이 생길 수 있습니다. 프리필과 디코드를 서로 다른 워커 풀에 배치하고 독립적으로 확장하는 분리형 서빙이 주목받는 배경입니다. 이 구조에는 KV 캐시를 빠르게 전달할 네트워크가 필요합니다. 요청 부하와 캐시의 위치를 파악해 적절한 워커로 전달하는 라우터와 스케줄러도 중요합니다.
이번 행사에서도 구체적인 사례를 확인할 수 있었습니다. SambaNova는 에이전트를 위한 분리형 추론 구성을 공개했습니다. 프리필과 디코드를 서로 다른 프로세서에 배치하고 CPU가 에이전트 조율을 맡는 이기종 접근입니다. 특정 제품 조합이 모든 환경의 정답이라는 뜻은 아닙니다. 추론의 각 단계에 맞춰 자원을 나누고 연결하려는 흐름이 실제 구현으로 이어지고 있다는 점에 의미가 있습니다.
분리형 서빙이 모든 환경에 적합한 것은 아닙니다. 프롬프트가 짧거나 동시 요청이 적다면 KV 캐시 전송 비용 때문에 통합형 구성이 더 효율적일 수 있습니다. 실제 워크로드를 기준으로 두 방식을 비교해야 합니다.
컴퓨팅부터 소프트웨어까지 통합의 관점으로 접근
앞서 왜 전체 경로를 살펴야 하는지를 알아보았습니다. 다음으로 알아볼 내용은 무엇을 어떻게 선택해야 하는지에 대한 것입니다. AI 챗봇부터 멀티 에이전트까지 다양한 도입 시나리오를 지원하려면 통합의 관점에서 접근해야 합니다. 하드웨어와 소프트웨어를 따로 설계해서는 목표 SLO를 만족하기 어렵습니다.
컴퓨팅 계층에서는 모델의 크기와 구조, 정밀도, 목표 처리량에 맞는 가속기를 선택해야 합니다. GPU는 큰 모델과 변화가 잦은 워크로드에 유연합니다. NPU와 ASIC 등 추론에 특화된 전용 가속기는 지원 모델과 연산이 잘 맞을 때 전력 효율과 비용에서 장점을 낼 수 있습니다. CPU는 요청 처리와 검색, 라우팅과 에이전트 조율을 맡습니다.
중요한 것은 여러 종류의 프로세서를 많이 섞는 일이 아닙니다. 모델 호환성과 정확도, 개발 도구, 장애 대응까지 포함해 운영 가능한 조합을 만들어야 합니다. 가속기 단독 성능이 좋아도 모델 변환에 오랜 시간이 들거나 서빙 소프트웨어를 충분히 활용하지 못하면 전체 효율은 낮아집니다.
메모리와 스토리지에서는 모델 가중치와 KV 캐시를 어디에 둘지 정해야 합니다. 모든 데이터를 HBM에 계속 보관하기는 어렵습니다. 자주 쓰는 KV 캐시는 HBM에 두고, 재사용 가능성이 있는 캐시는 호스트 메모리나 SSD로 옮기는 계층화를 고려할 수 있습니다. 캐시를 불러오는 시간이 다시 계산하는 시간보다 짧은지도 측정해야 합니다.
에이전틱 AI가 스토리지를 성능 경로로 끌어올렸다는 점도 이번 행사에서 눈에 띈 변화였습니다. 에이전트가 긴 컨텍스트를 유지하고 도구 호출을 반복할수록 이미 계산한 맥락을 다시 활용하는 능력이 중요해집니다. 스토리지를 단순한 보관 공간이 아니라 메모리 계층의 일부로 바라봐야 하는 이유입니다.
네트워크는 가속기 사이의 연결만 담당하지 않습니다. 프런트엔드와 스토리지, 프리필과 디코드 사이의 데이터 이동도 담당합니다. 혼잡과 패킷 손실을 빠르게 찾고 워크로드에 맞춰 경로를 조정할 수 있는 관측성이 필요합니다. 추론 엔진은 배치 크기와 요청 순서, 메모리와 캐시 사용 방식을 결정합니다.
정리하자면 추론 시대의 AI 인프라 최적화는 컴퓨팅과 메모리, 스토리지, 데이터 이동, 네트워크와 소프트웨어를 함께 조정하는 풀스택 작업입니다. 이 작업은 한번 하면 끝이 아닙니다. 소프트웨어와 커널, 분산 추론 방식은 계속 바뀝니다. 같은 하드웨어도 설정과 소프트웨어 버전에 따라 다른 결과를 냅니다. 한 번 측정한 최고 수치보다 실제 서비스와 비슷한 조건에서 반복해서 검증하며 지속해서 개선해야 합니다.
RAISE Summit 2026이 보여준 추론 인프라의 방향
RAISE Summit 2026 현장에서 확인한 변화는 분명했습니다. AI 인프라의 중심은 모델 학습에서 지속적인 추론 운영으로 이동하고 있습니다. 평가 기준도 가속기 사양에서 응답 속도와 처리량, 데이터 이동과 토큰당 비용을 아우르는 풀스택 효율로 넓어졌습니다.
추론 시대의 경쟁력은 최신 AI 가속기를 확보하는 것만으로 완성되지 않습니다. 워크로드에 맞는 자원을 고르고 데이터가 이동하는 전체 경로를 유연하게 조정해야 합니다. 실제 운영 조건에서 반복해서 검증하는 역량도 중요합니다.
대원씨티에스는 서버와 AI 가속기, 네트워크, 스토리지와 AI 플랫폼을 풀스택 관점에서 검토합니다. 고객의 요청 특성과 SLO를 기준으로 아키텍처를 설계하고 목적에 맞는 솔루션을 공급합니다. 더불어 실제 서비스와 유사한 조건에서 모델 서빙과 인프라 구성을 검증할 수 있는 테스트 환경인 AI Experience Lab도 운영 중입니다.
현재 인프라의 활용률을 높이거나 새로운 추론 서비스를 위한 아키텍처를 검토하고 계시다면 대원씨티에스로 문의 바랍니다.
참고 자료
.png)



댓글