AI 추론 비용 경쟁: 프리필·디코드 분리와 KV 캐시가 좌우하는 서빙 효율, 발표 수치 읽는 법
오픈AI와 AMD·세레브라스가 한 달 사이 내놓은 발표는 새 칩 없이 추론 비용을 낮추는 방법을 보여준다. 프리필과 디코드를 나누는 구조, KV 캐시 이동 속도, 발표 수치를 어디까지 믿어야 하는지 정리했다.
핵심 내용 읽기 →AI TOPIC
AMD 관련 핵심 뉴스와 활용 인사이트 6편을 최신순으로 모았습니다.

오픈AI와 AMD·세레브라스가 한 달 사이 내놓은 발표는 새 칩 없이 추론 비용을 낮추는 방법을 보여준다. 프리필과 디코드를 나누는 구조, KV 캐시 이동 속도, 발표 수치를 어디까지 믿어야 하는지 정리했다.
핵심 내용 읽기 →
128GB 메모리를 가진 소형 AI PC 두 대를 10기가 이더넷으로 묶어 3,580억·3,970억 파라미터 모델을 실제로 돌려본 실험. 두 가지 클러스터 방식과 실제 토큰 속도를 정리했다.
핵심 내용 읽기 →
AMD 라이젠 AI 맥스+ 395(128GB 통합 메모리) 미니 PC로 GPT-OSS 120B와 Qwen 3.6 같은 대형 오픈웨이트 모델을 로컬에서 돌려본 샘 위트빈의 실사용 후기. 토큰 속도, 이미지·영상 생성, 파인튜닝, 로컬 AI의 비용 이점을 정리했다.
핵심 내용 읽기 →
AMD가 스트릭스 헤일로(라이젠 AI Max+ 395) 칩을 담은 4,000달러 미니 AI 박스를 내놨다. DGX 스파크와의 토큰 생성·프리필 속도, 128GB 통합 메모리, x86·NPU 이점, 사전 설치 소프트웨어까지 실측 비교를 정리했다.
핵심 내용 읽기 →
1,500달러 AMD 라이젠 AI 맥스+ 미니 PC가 4,700달러 엔비디아 DGX 스파크가 아예 못 올리는 1,200억 파라미터 모델을 구동한다. 통합 메모리·대역폭·소프트웨어 성숙도까지 냉정하게 따져 본 2026년 로컬 AI 머신 선택 기준.
핵심 내용 읽기 →
같은 AMD 라이젠 미니 PC에서 윈도우·WSL·바탕 리눅스로 로컬 LLM을 돌려 비교했다. 긴 프롬프트 처리는 리눅스 radv가 약 3배 빨랐고, 토큰 생성의 진짜 병목은 연산이 아니라 메모리 대역폭이라 듀얼 채널 램으로 속도가 두 배로 뛰었다.
핵심 내용 읽기 →