인터넷신문위원회
ad
ad
ad
ad

logo

ad
ad
ad
ad
ad
ad

HOME  >  사회

숙명여대 김병규 교수팀, 실시간 반응 '공감형 AI' 원천기술 개발

입력 2026-08-14 08:46

- 국국제학술대회 ‘ACM 멀티미디어 챌린지’ 2위… 11월 브라질 구두 발표 채택
- 기존 AI 한계 극복해 대화 맥락과 개인 특성 반영한 맞춤형 표정 생성
- 개인별 반응 스타일 정밀 구현…챗봇·휴머노이드 로봇 등 정서 교감 서비스 활용 기대

[비욘드포스트 이봉진 기자] 숙명여자대학교(총장 문시연) 인공지능공학부 김병규 교수 연구팀이 대화 상대의 말과 표정에 실시간으로 반응하고, 개인별 표정 특성을 반영하는 공감형 인공지능(AI) 모델을 개발했다.
(왼쪽부터) 숙명여대 인공지능공학부 김병규 교수, 최지훈 연구원. (사진제공=숙명여대)
(왼쪽부터) 숙명여대 인공지능공학부 김병규 교수, 최지훈 연구원. (사진제공=숙명여대)
숙명여대는 김 교수팀이 컴퓨터 비전 및 멀티미디어 분야 국제학술대회인 ‘ACM 멀티미디어(ACM Multimedia)’가 주관하는 ‘REACT26 그랜드 챌린지(REACT26 Grand Challenge)’에서 2위를 기록했다고 14일 밝혔다.

이번 연구 성과는 오는 11월 브라질 리우데자네이루에서 열리는 학술대회 구두 발표 세션에 채택됐다. 연구팀이 제안한 기술 ‘케어디프(CaReDiff)’는 대화 상황에서 청자가 화자의 말과 표정에 반응해 자연스러운 표정을 짓는 영상을 생성하는 AI 모델이다.

기존 AI 모델은 반응 시점과 표정을 동시에 학습하는 구조 탓에 실시간 대화에서 반응 타이밍이 어긋나거나, 개인별 스타일을 반영할 때 기존 학습된 패턴이 훼손되는 한계가 있었다.

연구팀은 이를 해결하기 위해 반응 시점을 명시적으로 맞추는 ‘인과적 교차 주의(causal lead-lag cross-attention)’ 기법과 전체적인 표정 흐름을 계획한 뒤 세부 사항을 다듬는 ‘단계적(coarse-to-fine) 표정 계획’ 방식을 결합했다.

화자-청자 반응 타이밍을 정렬하는 인과적 교차 주의 기반 디퓨전 프레임워크 구조. (사진제공=숙명여대)
화자-청자 반응 타이밍을 정렬하는 인과적 교차 주의 기반 디퓨전 프레임워크 구조. (사진제공=숙명여대)
또한, 개인 맞춤형 표정 생성을 위해 ‘개인화 잔차 어댑터(Personalised Residual Adapter)’라는 경량 보정 모듈을 추가했다. 전체 파라미터의 1% 미만만 추가로 학습시키는 방식을 통해, 기존 모델의 기본 성능은 유지하면서도 성격 특성과 과거 행동 패턴을 반영한 개인별 반응 스타일을 구현해 냈다.

연구팀은 MARS 데이터셋을 활용한 실험을 통해 기술의 실효성을 검증했다. 반응의 적절성을 나타내는 FRCorr 지표를 측정한 결과, 실시간(온라인) 설정에서 기존 0.5680이던 수치가 0.6462로 향상됐다. 개인화 모듈을 적용했을 때도 오프라인 기준 0.5899에서 0.7868로, 실시간 기준 0.5475에서 0.6510으로 각각 높아져 성능 향상을 입증했다.

이 기술은 향후 챗봇, 소셜 로봇, 휴머노이드 로봇 등 인간과 정서적으로 교감해야 하는 다양한 인공지능 서비스 분야에 핵심 기술로 활용될 전망이다. 이번 연구는 최지훈 연구원이 제1저자로 참여했으며, 최세인, 이한슬, 큐라울아인아이샤 연구원이 공동 참여했다.

김병규 교수는 “이번 성과는 AI가 사람의 대화 맥락과 개인 특성을 이해하고 적절한 시점에 반응할 수 있도록 하는 원천기술을 확보했다는 데 의의가 있다”며 “인간의 감정과 의도를 이해해 자연스럽게 교감할 수 있는 사람 중심의 공감형 AI 기술을 고도화해 나갈 것”이라고 말했다.

bjlee@beyondpost.co.kr

<저작권자 © 비욘드포스트, 무단 전재 및 재배포 금지>