인공지능학과 장두성 교수 연구팀, COLM 2026 논문 채택

▲ (좌측부터) 인공지능학과 장두성교수, 박현빈 석사과정
본교 인공지능학과 NLP&ISDS 연구실 장두성 교수 연구팀(인공지능학과 박현빈 석사과정)이 제출한 연구 논문 ‘Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO’가 언어모델링 분야 국제학술대회인 ‘Conference on Language Modeling (COLM) 2026’에 채택됐다.
이번 연구는 대규모 언어 모델(LLM)의 추론 능력을 향상시키기 위한 강화학습 과정에서 기존 학습 경험을 효과적으로 재활용하여 학습 효율을 높이는 방법을 다룬다. COLM은 언어 모델의 학습과 개선, 분석을 폭넓게 다루는 국제학술대회로, 사전학습과 후속학습(post-training), 강화학습, 데이터 등 언어 모델과 관련된 다양한 연구 성과가 발표된다.
박현빈 석사과정생의 논문에서는 LLM 강화학습에서 과거에 생성한 학습 경험을 다시 활용하는 Headroom-Drift Replay 기법을 제안하였다. 기존의 강화학습은 모델이 학습할 때마다 새로운 응답이나 문제 해결 과정을 반복적으로 생성해야 해 많은 계산 비용과 시간이 필요한데, 제안된 방법은 기존 학습 데이터를 단순히 재사용하는 대신 아직 학습할 가치가 충분한 경험인지(Headroom)와 현재 모델의 상태에서도 안정적으로 활용할 수 있는 경험인지(Policy Drift)를 함께 고려해 재사용할 데이터를 선별한다. 이를 통해 추가적인 데이터 생성 과정 없이 기존 경험을 보다 효과적으로 활용할 수 있도록 하였다.
수학 추론, 멀티모달 추론, Agentic Search 등 다양한 환경에서 실험한 결과, 제안한 Headroom-Drift Replay는 단순히 과거 데이터를 재사용하는 방식보다 일관되게 높은 성능을 보였으며, 보다 복잡한 기존 replay 학습 방식과 비교해서도 동등하거나 우수한 성능을 기록하였다. 특히 외부 환경과 반복적으로 상호작용해야 하는 Agentic Search 환경에서는 새로운 데이터를 더 많이 생성하는 방식보다 높은 성능을 달성하면서도 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄여, LLM 강화학습의 성능과 효율성을 동시에 개선할 수 있음을 확인하였다.
한편, 이번 연구는 과학기술정보통신부가 주관하고 정보통신산업진흥원(NIPA)이 지원하는 Sovereign AI Foundation Model Project(GPU Track)(PJT-26-010017)의 일환으로 수행됐다. 또한 과학기술정보통신부의 지원을 받아 정보통신기획평가원(IITP)이 주관하는 Top-Tier AI Global HRD Invitation Program(RS-2025-25461932)의 지원을 받아 수행됐다.
해당 논문은 2026년 10월 6일부터 9일까지 미국 샌프란시스코에서 개최되는 COLM 2026에서 발표될 예정이다.
이번 연구는 대규모 언어 모델의 추론 능력을 향상시키는 강화학습 과정에서 이미 생성된 경험을 어떤 기준으로 다시 활용할 것인지에 주목한 연구다. 연구팀은 “새로운 학습 데이터를 지속적으로 생성하는 데 드는 비용을 줄이면서도 학습에 유용한 경험을 효과적으로 선별할 수 있다는 가능성을 확인했다는 점에서 의미가 있다”라며 “향후 다양한 강화학습 환경과 대규모 언어 모델에 적용함으로써 보다 효율적이고 안정적인 AI 모델 학습 기술로 발전시켜 나갈 수 있을 것으로 기대한다”라고 소감을 밝혔다.
'Board > News' 카테고리의 다른 글
| INTERSPEECH 2026 논문 2편 채택 (0) | 2026.08.19 |
|---|---|
| NLP & ISDS 연구실, 한국컴퓨터종합학술대회 (KCC 2026) 특별 공로상 수상 (0) | 2026.06.29 |
| 자연어처리 최고 학회 'ACL 2026' 구두 발표 선정 (0) | 2026.06.25 |
| 서강학개론 시즌3, 'AI 시대, 다시 인간을 묻다' 유튜브 공개 (0) | 2026.06.25 |
| 장두성 교수, 서강대 총동문회 알바트로스 학술상 수상 (0) | 2026.06.25 |