# 프랙타일이 메모리 대역폭에 건 이유: 빠른 AI 추론과 긴 문맥을 함께 처리하려면

> 2026-10-02 · No Priors · 큐레이션 김태우
> https://challengekim.com/insights/프랙타일이-메모리-대역폭에-건-이유-빠른-ai-추론과-긴-문맥을-함께-처리하려면
> 원문: https://www.youtube.com/watch?v=OpeCP4wCxkA

## 핵심 요약

- 프랙타일은 대형 AI 모델의 **추론**, 즉 학습한 모델로 답을 생성하는 작업을 빠르게 처리하는 칩을 개발한다. 창업자 월터 굿윈은 특히 오래 실행되는 에이전트에서 속도가 중요하다고 본다.
- 초기에는 칩 내부의 고속 메모리인 SRAM에 집중했지만, 모델 크기와 문맥 길이가 늘어나는 상황에서 용량의 한계를 우려했다. 현재는 용량이 크고 비용이 낮은 DRAM에 매우 높은 대역폭으로 접근하는 설계를 추진한다.
- 굿윈은 칩 설계 기간을 줄일 수 있다고 보면서도 제조에 걸리는 시간과 투자비 회수 기간 때문에 새 칩을 몇 주마다 내놓을 수는 없다고 설명한다.
- 그는 대형 AI 개발사가 공급처를 다양하게 확보하려 할 것이며, 하나의 독자적인 칩 설계에 전적으로 의존하는 데에는 위험이 따른다고 주장한다.

## 빠른 추론의 병목은 메모리에 있다

프랙타일은 2022년 여름 설립됐다. 굿윈은 창업 당시부터 대형 모델이 답을 생성하는 속도에 주목했다고 말했다. 모델이 문제를 풀기 위해 더 오래 계산하는 방향으로 발전한다면, 같은 시간에 더 많은 추론을 수행하는 능력이 중요해진다는 판단이었다.

굿윈이 특히 강조한 작업은 오래 실행되는 에이전트다. 그의 설명에 따르면 빠른 추론 칩은 높은 메모리 대역폭을 갖췄지만 메모리 용량이 작아, 긴 문맥을 처리하는 어텐션 연산은 여전히 GPU로 넘기는 경우가 있다. **메모리 대역폭**은 칩이 모델의 가중치와 실행 중 생성되는 상태 정보를 얼마나 빨리 읽어 올 수 있는지를 뜻한다. 속도를 높이면서 긴 문맥까지 다루려면 높은 대역폭과 충분한 용량이 함께 필요하다는 것이 그의 주장이다.

용량은 비용 문제이기도 하다. 굿윈은 데이터센터에서 수천 명에게 추론 서비스를 제공할 때 메모리의 기가바이트당 비용이 경제성을 좌우한다고 설명했다.

## SRAM에서 고대역폭 DRAM으로 방향을 바꾸다

프랙타일은 설립 후 약 2년 동안 연산 회로와 같은 실리콘 위에 놓이는 SRAM 기반 칩을 연구했다. SRAM은 연산 회로와 모델 데이터 사이에 매우 높은 대역폭을 제공한다. 그러나 굿윈은 2023년 말부터 2024년 사이 모델의 매개변수뿐 아니라 처리해야 할 문맥도 길어지는 추세를 보며 이 방식의 확장성을 걱정하게 됐다고 말했다.

이후 프랙타일은 메모리 공급업체 및 칩 제조 파트너와 함께, 더 큰 용량의 DRAM에서 훨씬 높은 대역폭을 얻는 방법을 연구해 왔다. 굿윈은 이를 통해 고용량 메모리의 확장성과 고속 추론 칩의 속도상 이점을 결합한 플랫폼을 만들고 있으며, 인터뷰 시점을 기준으로 다음 해 하반기에 생산량을 늘릴 계획이라고 밝혔다. 이는 향후 계획에 대한 설명이지, 이미 대규모로 공급되고 있다는 뜻은 아니다.

그는 프랙타일이 구상하는 칩의 대역폭이 HBM 기반 칩의 칩당 대역폭보다 약 25배 높다고 설명했다. HBM은 GPU 등에 쓰이는 고대역폭 메모리다. 굿윈은 이런 차이가 더 적은 연산으로 비슷한 수준의 모델 성능을 얻는 설계에 도움이 될 가능성을 탐색하고 있다고 말했다. 예로 전문가 혼합 모델에서 한 번에 사용하는 부분을 더 줄이면 연산량을 아낄 수 있지만, 현재 칩에서는 데이터를 읽는 속도가 병목이 돼 효율적으로 서비스하기 어렵다고 설명했다. 이는 프랙타일이 검토하는 설계 방향이며, 해당 모델에서 성능 향상이 입증됐다는 발표는 아니다.

## 설계 속도를 높여도 제조 시간은 남는다

굿윈에 따르면 프랙타일은 약 150명 규모의 팀에 칩의 앞단 설계, 물리적 배치, 후단 구현과 첨단 패키징 인력을 함께 두고 있다. AI 모델의 작업 방식이 빠르게 바뀌는 만큼 여러 설계 판단을 내부에서 연결하려는 구조다. 그는 한 모델에만 맞춘 칩보다 여러 모델에 공통으로 필요한 특성을 찾는 일이 중요하며, 메모리 대역폭을 그런 특성 중 하나로 꼽았다.

설계 과정을 단축해도 물리적 한계는 남는다. 굿윈은 설계를 제조사에 넘긴 뒤 칩을 받기까지, 빠르게 진행하는 경우에도 약 3\~5개월이 걸린다고 말했다. 칩을 경제적으로 운용하려면 대체로 3\~5년에 걸쳐 투자비를 회수해야 한다는 설명도 덧붙였다. 생산량을 늘리는 과정에도 12\~18개월이 걸릴 수 있다. 그가 설계 기간 단축에서 기대하는 효과는 몇 주마다 완전히 새로운 칩을 출하하는 것이 아니라, 여러 설계안을 검토하고 적절한 시점에 생산할 칩을 고를 기회를 늘리는 것이다.

AI가 칩 설계를 도울 가능성에도 같은 구분을 적용했다. 굿윈은 초기 설계와 반복 작업을 빠르게 하는 방안을 검토하지만, 회로 배치 도구가 오래 실행되는 문제와 제조 규칙을 확인하는 최종 검증은 당분간 중요한 단계로 남을 것으로 봤다.

## AI 개발사가 여러 칩을 쓰려는 이유

굿윈은 대규모 AI 서비스를 운영하는 기업들이 공급 능력과 통제력을 확보하기 위해 여러 칩 플랫폼을 사용하려 한다고 말했다. 자체 칩이나 다른 공급사의 칩을 선택할 수 있다는 점이 기존 공급사와의 가격 협상에도 영향을 줄 수 있다는 해석이다.

그는 AI 개발사가 하나의 독자적인 칩 설계에 전적으로 의존하는 것도 위험하다고 주장했다. 경쟁사가 다른 칩에 잘 맞는 계산 방식으로 효율을 크게 높인다면, 기존 칩에 집중한 회사는 새 칩을 충분히 확보할 때까지 대응이 늦어질 수 있다는 가정이다. 굿윈은 이런 위험 때문에 개발사 사이에 공통으로 쓸 수 있는 외부 칩 플랫폼의 수요가 지속될 것으로 본다.

프랙타일의 선택은 메모리 대역폭을 높여 빠른 추론과 긴 문맥 처리를 함께 겨냥하는 것이다. 굿윈의 설명은 그 기술적 목표와 함께, 제조 기간·메모리 비용·칩의 사용 수명이 실제 도입을 결정하는 조건임을 보여준다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=OpeCP4wCxkA)
