kangnlp

Byungha Kang

NLP Researcher · AI Engineer @ Nurimedia(DBpia)

임베딩과 검색, LLM을 다루는 AI 엔지니어입니다. NLP로 석사를 마쳤고, 지금은 Nurimedia(DBpia)에서 일합니다. 읽은 논문이 휘발되는 게 아까워서 여기에 리뷰를 남기고, 일하며 배운 것들을 기록합니다.

Recent Writing

전체 보기 →
논문 리뷰45

논문 리뷰: A Programming Paradigm for Spatiotemporal Composability

플러그인을 하나 끄면 왜 프로세스 전체를 재시작해야 할까. VSCode에서 확장 하나를 비활성화하려면 확장 호스트 전체를 다시 띄워야 하고, 그 사이에 켜져 있던 다른 확장들의 상태도 전부 날아간다. 이 논문의 저자들이 조사한 바로는 설치 수 상위 100개 확장 중 87개가 실행 코드를 담고 있어서 제거하려면 이런 재시작을 요구한다. 우리가 매일 쓰는 도구

논문 리뷰31

논문 리뷰: Lost in a Single Vector - Improving Long-Document Retrieval with Chunk Evidence Aggregation

질의: "Industrial Designer는 회의가 브레인스토밍에 우호적이지 않다고 생각했다. 제약은 분위기가 아니라 실제 환경과 제한된 논의 시간에 관한 것이었다. 게다가 상호작용이 구조화되어 각자 한 가지 과제만 맡고 충분한 협업이 없었다. 이메일을 통한 소통도 비효율적이었다." 골드 문서 내 국소 근거: "the meetings ... are mo

논문 리뷰24

논문 리뷰: Fine-Grained Distillation for Long Document Retrieval

긴 문서는 여러 토픽을 담고 있어 크로스 인코더의 지식을 바이 인코더로 그대로 증류하면 잘 먹히지 않는다. 이 논문은 문서 전체가 아니라 문단, 문장 단위의 세밀한 표현으로 지식을 증류하는 Fine-Grained Distillation(FGD) 프레임워크를 제안해, 추론 효율은 그대로 유지하면서 장문서 검색에서 SOTA를 달성한다.

논문 리뷰39

논문 리뷰: LMK > CLS: Landmark Pooling for Dense Embeddings

문서 하나를 벡터 하나로 압축할 때 쓰는 [CLS]/mean 풀링의 고질적 약점을 짚고, 시퀀스 중간중간에 landmark 토큰을 꽂아 그 임베딩만 평균 내는 단순한 풀링으로 장문 검색 성능을 크게 끌어올린 연구.