AI/ML · 2026.08 – 09
DLC 2026 — Qwen2.5-3B 하나로 만든 3단 적응형 캐스케이드
세 모델이 문항마다 '표가 얼마나 모였는지'만 보고 다음 단계로 갈지 결정합니다. 주최측 제보로 리더보드 재편을 이끌어냈습니다.
ROLE개인전
RESULTLB 0.80385 · 결과 대기
STACKLLM · LoRA · STaR · 자기증류 · vLLM
LINKSRepository
GITHUBPython · 마지막 커밋 2026.08.29
문제
제5회 대학 연합 딥러닝 챌린지 2026. 베이스 모델은 Qwen/Qwen2.5-3B-Instruct로 고정, 과제는 수학 문제를 읽고 정수 정답을 맞히는 것(Exact Match). 외부 API·도구 호출(TIR) 금지, 가중치 병합 금지, 파인튜닝만 허용. 3B 모델 하나로 얼마나 밀어붙일 수 있는지가 핵심이었습니다.
접근
한 모델의 성능을 올리는 데 한계가 보여서, 같은 베이스에서 파생한 세 모델을 단계적으로 부르는 캐스케이드로 설계를 바꿨습니다.
- STAR (LoRA r128, 대회 train 자기증류) — 32표를 생성해 최다 득표가 22표 이상이면 확정. 전체의 약 41%가 여기서 끝납니다.
- LONGCOT (full fine-tuning, R1 long-CoT 증류) — 1단계에서 확정되지 않은 문항에 32표를 더해 64표. 1·2위 격차가 5표를 넘으면 확정(약 46%).
- STAR-OLY (LoRA r128, 외부 경시 풀 자기증류) — 남은 접전 문항(약 13%)에 32표를 추가해 96표로 결정.
분기 조건은 표 구조뿐입니다. 문제의 주제·출처·정답을 보지 않으므로 유형별 라우팅이 아니고, 어떤 문항이 어느 단계로 갈지는 생성 결과만으로 정해집니다. 2단계에 “다른 추론 체제”의 모델을 두는 이유는, 같은 모델의 표를 늘리는 것보다 서로 다른 실수를 하는 모델의 표를 섞는 쪽이 접전 문항에서 더 많이 뒤집혔기 때문입니다.
결과
- 리더보드 0.80385 (668 / 831). 3단계의 기여는 같은 생성 배치로 대조군을 재조립한 짝 검정으로 분리 확인했습니다(668 vs 665).
- 리더보드 문항 오류를 주최측에 제보해 LB가 1,000문항에서 831문항으로 재편되고 전 참가자가 재평가됐습니다. 2차 제보 14건 추가.
- 규정 회색지대 4건(체크포인트 평균, 증류 teacher 사용 범위 등)을 스스로 문서화해 공개하고, 검증 스크립트로 추론 경로에 네트워크 호출이 없음을 보였습니다.
- 최종 결과는 발표 대기 중입니다.
배운 점
- “더 큰 모델”이 아니라 “더 다른 모델”이 접전 문항을 가릅니다. 용량 사다리(8B → 14B)를 실측했더니 1.75배 증설이 순 +1문항이었습니다.
- 규정을 지키는 것과 규정을 지켰다고 증명하는 것은 다른 일입니다. 심사자가 grep 한 줄로 확인할 수 있게 저장소를 정리하는 데 마지막 이틀을 썼습니다.