AMD, 탈라스 품고 고정형 AI 추론칩 확대
핵심 요약
AMD가 AI 가중치를 칩에 직접 새기는 탈라스를 인수해 추론 반도체 선택지를 넓힌다. 탈라스 HC1은 초당 1만6960토큰의 처리 성능과 낮은 전력·구축 비용을 제시했다. 고정 모델과 매개변수 한계는 약점이지만 데이터센터와 피지컬 AI 활용 가능성이 확인된다.
AMD가 8월 6일 캐나다 AI 반도체 기업 탈라스를 인수한다고 밝혔다. 거래 조건은 공개하지 않았으며 인수 절차는 올해 안에 마칠 예정이다. 탈라스는 학습을 끝낸 AI 모델의 가중치를 실리콘에 직접 새기는 구조화 주문형 반도체 기업이다. 인수가 완료되면 해당 제품군은 AMD의 기존 하드웨어 포트폴리오에 선택형 구성으로 추가될 전망이다.
탈라스 창업자는 텐스토렌트 공동창업자이자 전 최고경영자인 류비사 바지치다. 탈라스 칩은 노광 과정에서 가중치를 금속 배선에 고정하는 마스크-ROM 리콜 패브릭과 KV 캐시·저순위 적용처럼 바뀌는 데이터를 읽고 쓰는 SRAM 리콜 패브릭으로 구성된다. 1세대 HC1은 라마 3 계열 8B 모델을 탑재해 초당 1만6960토큰을 생성했다. H200의 230토큰, B200의 353토큰, 세레브라스의 1981토큰보다 높은 수치다. 전력 소비는 10분의 1, 구축 비용은 20분의 1 수준으로 제시됐다.
이 구조는 가중치를 메모리에서 반복해 불러오는 병목을 줄이지만, 칩에 새긴 모델 하나만 구동할 수 있다는 제약이 있다. HC1은 3비트 양자화와 6비트 매개변수를 함께 사용해 정확도가 다소 낮았고, HC2는 4비트 부동소수점 표준으로 이를 개선할 계획이다. HC2 한 개의 수용 한도는 200억 매개변수다. 1조 매개변수 모델은 칩 50개에 가중치를 나눠 기록하는 방식으로 처리할 수 있지만, 필요한 일부 매개변수만 활성화하는 전문가 혼합 모델도 전체 가중치를 인쇄해야 한다.
AMD는 자일링스의 FPGA, 펜산도의 DPU, ZT시스템의 서버·AI 인프라 역량을 확보해 헬리오스 서버 랙으로 결합해 왔다. 탈라스 기술은 오픈AI·앤트로픽·메타 등에 공급하는 단일 모델의 추론 비용을 낮추거나 경량 API 모델을 효율화하는 용도로 활용될 수 있다. 로보틱스 파트너 네트워크와 연계하면 엣지·로봇 장치에서 저전력 온디바이스 추론을 구현할 여지도 있다. 다만 두 개 금속층만 다시 설계해 새 모델을 적용하더라도 신형 모델의 빠른 교체 주기와 고정형 칩의 노후화 위험은 남는다.