진행 중
LLM 에이전트의 비용을 고려한 도구 사용
외부 도구를 호출하는 에이전트는 과제에 필요한 기능과 각 선택지의 비용을 함께 따져야 합니다. 이 판단이 얼마나 믿을 만한지, 무엇이 판단을 흐트러뜨리는지를 연구합니다.
LUMI Lab · 동국대학교
Language Understanding and Machine Intelligence
LUMI Lab은 동국대학교 컴퓨터AI학부 황예린 교수 연구실입니다. 자연어처리와 대규모 언어모델(LLM)을 중심으로 신뢰할 수 있는 AI를 연구하며, LLM 평가와 에이전트 신뢰성, 멀티모달 평가, AI 안전성이 주요 주제입니다.
연구실을 함께 만들어 갈 대학원생, 학부 연구인턴, 공동 연구자의 연락을 환영합니다!
자연어처리와 신뢰할 수 있는 AI, LLM 에이전트, 멀티모달 평가가 만나는 지점을 연구합니다. 벤치마크 점수가 높다고 해서 지시가 충돌하거나 평가가 편향되거나 앞선 결과를 고쳐야 하는 상황까지 잘 넘긴다는 보장은 없습니다. 저희는 모델이 이런 현실적인 조건에서 어디서부터 어긋나는지 확인하고, 그 동작을 개선할 benchmark와 분석 방법을 만듭니다.
진행 중인 연구
성능이 좋은 시스템도 실제 환경에서는 부족한 부분이 남습니다. 지금은 세 가지를 다루고 있습니다. 기능과 비용을 함께 따지는 판단, 지시가 충돌할 때 우선순위를 지키는 일, 그리고 어긋난 결과에서 회복하는 능력입니다.
진행 중
외부 도구를 호출하는 에이전트는 과제에 필요한 기능과 각 선택지의 비용을 함께 따져야 합니다. 이 판단이 얼마나 믿을 만한지, 무엇이 판단을 흐트러뜨리는지를 연구합니다.
진행 중
모델은 어느 출처의 지시가 더 우선하는지를 지켜야 합니다. 충돌하는 지시가 쌓이기 시작할 때 그 순서가 얼마나 버티는지를 연구합니다.
진행 중
편집 결과가 원하던 것과 다를 때, 모델은 무언가 잘못됐다는 것을 알아차리고 바로잡을 수 있을까요? 첫 시도의 성공률이 아니라 회복 능력을 평가하는 방법을 연구합니다.
연구 분야
모델이 무엇을 아는지보다 어떻게 판단하는지를 봅니다. 무엇을 먼저 따르는지, 도구를 어떻게 쓰는지, 첫 시도가 틀렸을 때 어떻게 대응하는지가 관심사입니다.
언어모델과 vision–language 모델을 평가자로 쓸 때 나타나는 편향과 강건성, 불확실성, 충실성을 연구합니다.
에이전트가 서로 충돌하거나 잘못된 신호를 받았을 때의 instruction hierarchy와 도구 사용, 비용을 고려한 판단, 안전성을 살펴봅니다.
모델이 스스로 실패를 진단하고, 실행 가능한 피드백을 만들고, 새로운 오류 없이 정확히 고칠 수 있는지를 평가합니다.
언어마다 다른 특성과 실제 환경에서의 동작을 반영하는 평가·학습 데이터와 지표, 분석 방법을 만듭니다.
Publications
현재 LUMI Lab에서 이어가고 있는 연구의 바탕이 된 논문들입니다.
소식
Two to the main conference and one to Findings.
연구실 지원
꼼꼼한 실험과 스스로 납득할 수 있는 평가로 신뢰할 수 있는 AI를 연구하고 싶은 학생과 공동 연구자의 연락을 환영합니다!