커뮤니티

연세대학교 시스템반도체공학과

학부뉴스

김슬기 연구원 (김대훈 교수 연구팀) 모바일 LLM 온디바이스 추론을 위한 하드웨어 기반 온칩 메모리 관리 기술 ISCA 2026에 채택

페이지 정보

작성자 최고관리자 댓글 조회 조회 732회 작성일 26-05-27 09:27

본문

김대훈 교수 연구팀이 모바일 환경에서 대규모 언어 모델(LLM)온디바이스 추론 성능을 극대화하는 하드웨어 기반 온칩 메모리 관리 프레임워크인 'SMOOTH'를 제안했다. 최근 실시간 응답성과 프라이버시 보호를 위해 모바일 기기에서 직접 모델을 구동하려는 온디바이스 AI 수요가 급증하고 있으나, 모바일 SoC 특유의 제한된 온칩 SRAM(2~8 MB) 용량과 낮은 LPDDR5 오프칩 대역폭은 심각한 메모리 병목 현상을 초래해왔다.


기존의 모바일 시스템은 딥러닝 컴파일러 중심의 정적인 타일 수준 메모리 할당 방식에 의존하여 자원 활용의 한계를 보였다. 특히 트랜스포머 기반 모델은 디코딩 과정에서 선형 연산과 비선형 연산이 교차하며 극심하게 변동하는 버스트 I/O 트래픽을 발생시키는데, 정적인 컴파일러는 이러한 동적 대역폭 변화를 예측하기 어려웠다. 또한, 연산 효율을 높이기 위한 연산자 융합 기법이 중간 데이터의 수명을 연장하고, 물리적으로 연속된 메모리 공간만을 요구하는 기존 할당 제약과 맞물려 심각한 메모리 단편화를 야기했다.


이러한 맹점을 극복하기 위해, 연구팀은 세밀한 블록 단위로 온칩 메모리를 가상화하여 논리적 텐서 구조와 물리적 SRAM 배치를 분리하는 하드웨어 기반 설계인 SMOOTH를 고안했다. 연산이 연속된 주소에 접근할 때는 주소 변환 과정을 우회하는 하이브리드 메커니즘을 결합하여 가상화 오버헤드를 제로 수준으로 최소화했다. 동시에, 하드웨어 주도적인 조기 회수 메커니즘을 통합하여 버퍼 수준의 사용 상태를 실시간으로 추적하고 사용이 끝난 블록을 즉각 해제함으로써, 유휴 대역폭 구간에 미래의 데이터를 공격적으로 선적재하는 파이프라이닝을 실현했다.


SMOOTH는 사이클 수준의 시뮬레이터(LLMCompass)RTL 합성을 거친 하드웨어 모듈을 통합한 검증에서 괄목할 만한 성과를 보였다. 메모리가 제한된 모바일 SoC 환경에서 기존 최적화 컴파일러 및 하드웨어 기술 대비 첫 토큰 생성 시간(TTFT)을 최대 59.2% 단축시켰으며, 전체 생성 지연 시간을 의미하는 TTLT를 최대 73.0%까지 감소시켰다. 나아가 효율적인 온칩 메모리 재사용을 통해 모델 추론 에너지를 평균 최대 51.2%까지 획기적으로 절감하는 데 성공했다.


이러한 연구 성과는 논문 "SMOOTH: Hardware-Assisted Fine-Grained On-Chip Memory Management for Efficient On-Device LLM Inference"로 컴퓨터 구조 분야의 최고 권위 학회 중 하나인 International Symposium on Computer Architecture (ISCA 2026)에 채택되었다.

 

해당 연구는 김대훈 교수(교신저자)의 지도 하에 김슬기 연구원(1저자)이 주도하였다.

 

[03722] 서울특별시 서대문구 연세로 50 제1공학관 A663호 시스템반도체공학과

copyrights (c) 2017 yonsei university Department of Systems Semiconductor Engineering. All rights reserved. Designed by dsso.kr

팝업레이어 알림

팝업레이어 알림이 없습니다.