무엇을 연구하는가

지시가 충돌하고 평가가 편향될 때도 믿을 수 있는 AI

성능이 좋은 모델도 질문 하나만 깔끔하게 주어진 상황에서는 안정적으로 보입니다. 하지만 목표가 서로 충돌하거나, 평가 신호가 편향되어 있거나, 도구마다 비용이 다르거나, 앞서 내놓은 답을 고쳐야 할 때는 쉽게 무너집니다. 저희는 이런 상황을 측정할 수 있는 문제로 바꾸고, 통제된 실험으로 겉으로 드러나는 동작과 그 이면의 원인을 함께 확인합니다.

연구 분야

네 가지 방향

네 분야 모두 평균 점수로는 문제없어 보이는 능력이 조건이 까다로워질 때 어디서부터 무너지는지를 다룹니다.

  • 신뢰할 수 있는 평가

    언어모델과 vision–language 모델을 평가자로 쓸 때 나타나는 편향과 강건성, 불확실성, 충실성을 연구합니다.

    • LLM-as-a-Judge
    • Evaluation
    • Robustness
  • 에이전트 신뢰성

    에이전트가 서로 충돌하거나 잘못된 신호를 받았을 때의 instruction hierarchy와 도구 사용, 비용을 고려한 판단, 안전성을 살펴봅니다.

    • Agent Reliability
    • Tool Use
    • AI Safety
  • 피드백과 멀티모달 시스템

    모델이 스스로 실패를 진단하고, 실행 가능한 피드백을 만들고, 새로운 오류 없이 정확히 고칠 수 있는지를 평가합니다.

    • Multimodal AI
    • Feedback
    • Image Editing
  • 데이터 중심 연구와 한국어 NLP

    언어마다 다른 특성과 실제 환경에서의 동작을 반영하는 평가·학습 데이터와 지표, 분석 방법을 만듭니다.

    • Data Generation
    • Evaluation Data
    • Korean NLP

진행 중인 연구

지금 진행 중인 연구

현재 연구실의 실험은 대부분 아래 세 가지 주제를 중심으로 진행됩니다.

진행 중

LLM 에이전트의 비용을 고려한 도구 사용

  • LLM Agents
  • Tool Use
  • Cost-Aware Reasoning

에이전트가 외부 도구와 API로 처리하는 일이 늘어나면서, 도구를 고르는 일은 더 이상 기능만의 문제가 아니게 되었습니다. 같은 작업을 처리하는 도구라도 비용은 크게 다를 수 있고, 사람이 지켜보지 않는 상태에서 에이전트는 이 선택을 수없이 반복합니다. 배포된 시스템이 기능과 비용을 합리적으로 저울질할 것이라고 흔히 가정하지만, 실제로 그런지에 대한 체계적인 근거는 많지 않습니다.

저희는 에이전트가 이 판단을 얼마나 안정적으로 내리는지, 그리고 도구가 어떻게 제시되느냐에 따라 판단이 어느 쪽으로 밀려나는지를 살펴봅니다. 이런 문제는 틀린 답으로 드러나지 않습니다. 대신 시스템이 조용히 더 비싸지고 덜 예측 가능해지는 형태로 나타나기 때문에, 운영 환경까지 그대로 살아남기 쉽습니다.

진행 중

충돌이 쌓일 때의 지시 위계

  • AI Safety
  • Instruction Following
  • Model Behavior

실제로 배포된 언어모델은 여러 곳에서 동시에 지시를 받습니다. system prompt, 개발자, 사용자, 검색해 온 문서, 그리고 스스로 호출한 도구의 출력까지입니다. 이 출처들 사이의 권한 순서를 지키는 일에 모델 안전성의 상당 부분이 걸려 있습니다. 깔끔한 충돌 하나만 있는 상황은 쉬운 편이고, 요즘 모델은 대체로 잘 처리합니다.

문제는 실제 환경이 그렇게 단순하지 않다는 점입니다. 지시는 계속 쌓이고, 서로 어긋나며, 신뢰도가 전혀 다른 출처에서 들어옵니다. 저희는 이런 압력 아래에서 지시의 우선순위가 얼마나 유지되는지, 그리고 어디서부터 무너지는지를 연구합니다. 상황이 단순할 때만 올바른 출처를 따르는 시스템은, 정작 중요한 순간에 믿을 수 없기 때문입니다.

진행 중

이미지 편집에서의 피드백과 수정

  • Multimodal Evaluation
  • Image Editing
  • Feedback

instruction-guided image editing 연구는 대부분 모델이 새로 주어진 지시를 제대로 수행하는지를 봅니다. 하지만 이미 한 번 시도한 결과가 어긋났을 때 무슨 일이 벌어지는지는 훨씬 덜 알려져 있습니다. 실제 사용자가 마주하는 상황은 후자입니다. 편집은 원래 반복적인 작업이라, 요청하고, 비슷하지만 만족스럽지 않은 결과를 받고, 거기서부터 다시 이어집니다.

저희는 멀티모달 시스템이 이 상황을 어떻게 다루는지 평가하는 문제를 연구합니다. 결과가 의도에서 벗어났다는 것을 모델이 알아차릴 수 있는지, 그리고 이미지의 나머지 부분을 망가뜨리지 않으면서 고칠 수 있는지가 핵심입니다. 둘 다 실제로 쓸 만한 편집 도구를 만드는 데 필요한 능력이지만, 한 번의 시도만 측정해서는 알 수 없습니다.

연구 방법

연구하는 방식

benchmark 설계, 행동 기반 평가, 사람과 모델을 함께 활용한 분석, 그리고 통제된 실험을 함께 사용합니다. 모든 프로젝트에서 보통 한꺼번에 측정되는 능력들을 따로 떼어 보려 합니다. 시스템이 실패했는지만이 아니라, 어떤 능력이 어떤 조건에서 부족했는지까지 평가가 알려줄 수 있어야 하기 때문입니다.

  • 제대로 측정하기

    정말 알고 싶은 능력만 따로 떼어 볼 수 있도록 평가를 설계합니다.

  • 실제 조건에서 시험하기

    지시 충돌과 피드백, 불완전한 출력, 배포 환경의 제약 속에서 모델이 어떻게 동작하는지 봅니다.

  • 실패의 원인 찾기

    종합 점수에 머무르지 않고, 왜 그렇게 동작하는지까지 파고듭니다.

공동 연구

함께 연구하기

평가, 에이전트 신뢰성, AI 안전성 분야의 학계·산업계 공동 연구를 환영합니다. 이 주제를 함께 연구하고 싶은 학생의 연락도 언제든 환영합니다!