Game AI · 2026.07 – 08
AID Rummikub — 학습된 루미큐브 에이전트
2인 루미큐브(104타일)에서 그리디 ILP 베이스라인을 이기는 에이전트. 탐색은 선생, 최종 수 선택은 네트워크가.
ROLE팀 (AID)
RESULT최우수상
STACKPyTorch · 증류 · RL · ILP
문제
동아리 대회 과제. 조커 없는 2인 루미큐브에서 그리디 ILP 베이스라인을 이겨야 하고, 최종 에이전트는 학습된 에이전트여야 한다는 제약이 있었습니다. 합법 수 생성은 솔버가 해도 되지만, 어떤 수를 둘지는 네트워크가 결정해야 합니다.
접근
- 탐색 에이전트를 최종 제출물이 아니라 증류 데이터 생성기로 썼습니다.
- 단계적으로: 미드게임은 네트워크, 손패 5장 이하 종반은 DFS를 허용하는 하이브리드(수준 2)를 먼저 만들고 네트워크 기여를 ablation으로 증명한 뒤, 순수 네트워크(수준 3)로 갔습니다.
- 희소 보상, critic 사전학습, 랭크 앵커를 붙인 RL 파인튜닝.
greedy_hold베이스라인과 교착 종료 옵션으로 학습 환경을 안정화.
결과
AID 최우수상.