kangnlp

Tags /

#LLM

18개의 글

논문 리뷰32

논문 리뷰: Let LRMs Break Free from Overthinking via Self-Braking Tuning

"2 더하기 3은?" 이 문제에 사람은 1초도 안 걸린다. 그런데 DeepSeek-R1이나 OpenAI o1 같은 대형 추론 모델(Large Reasoning Model, LRM)에게 물어보면 어떻게 될까? 이 논문의 Figure 1에 나오는 실제 사례를 보면, DeepSeek-R1-Distill-Qwen-7B는 이 간단한 질문에 무려 672개의 토큰을 쓰

논문 리뷰23

논문 리뷰: LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin

명령어 데이터를 대규모로 늘리면 다운스트림 태스크 성능은 오르지만 사전학습에서 얻은 세계 지식(world knowledge)이 무너진다. LoRAMoE는 백본을 얼린 채 여러 LoRA를 전문가로 삼고 라우터로 묶는 MoE 스타일 플러그인으로, 전문가 일부를 세계 지식 전담으로 "부드럽게" 밀어붙여 두 마리 토끼를 동시에 잡는다.