← Projects
AI/ML · 2026.08 – 09

DLC 2026 — Qwen2.5-3B 하나로 만든 3단 적응형 캐스케이드

세 모델이 문항마다 '표가 얼마나 모였는지'만 보고 다음 단계로 갈지 결정합니다. 주최측 제보로 리더보드 재편을 이끌어냈습니다.

ROLE개인전
RESULTLB 0.80385 · 결과 대기
STACKLLM · LoRA · STaR · 자기증류 · vLLM
LINKSRepository
GITHUBPython · 마지막 커밋 2026.08.29

문제

제5회 대학 연합 딥러닝 챌린지 2026. 베이스 모델은 Qwen/Qwen2.5-3B-Instruct로 고정, 과제는 수학 문제를 읽고 정수 정답을 맞히는 것(Exact Match). 외부 API·도구 호출(TIR) 금지, 가중치 병합 금지, 파인튜닝만 허용. 3B 모델 하나로 얼마나 밀어붙일 수 있는지가 핵심이었습니다.

접근

한 모델의 성능을 올리는 데 한계가 보여서, 같은 베이스에서 파생한 세 모델을 단계적으로 부르는 캐스케이드로 설계를 바꿨습니다.

  1. STAR (LoRA r128, 대회 train 자기증류) — 32표를 생성해 최다 득표가 22표 이상이면 확정. 전체의 약 41%가 여기서 끝납니다.
  2. LONGCOT (full fine-tuning, R1 long-CoT 증류) — 1단계에서 확정되지 않은 문항에 32표를 더해 64표. 1·2위 격차가 5표를 넘으면 확정(약 46%).
  3. STAR-OLY (LoRA r128, 외부 경시 풀 자기증류) — 남은 접전 문항(약 13%)에 32표를 추가해 96표로 결정.

분기 조건은 표 구조뿐입니다. 문제의 주제·출처·정답을 보지 않으므로 유형별 라우팅이 아니고, 어떤 문항이 어느 단계로 갈지는 생성 결과만으로 정해집니다. 2단계에 “다른 추론 체제”의 모델을 두는 이유는, 같은 모델의 표를 늘리는 것보다 서로 다른 실수를 하는 모델의 표를 섞는 쪽이 접전 문항에서 더 많이 뒤집혔기 때문입니다.

결과

배운 점