본문으로 건너뛰기

소리로 볼 순간을 고르는 AI, 영상 분석 52초를 18초로 줄였다

JAIST 오카다 연구진의 EMF-dVAE는 오디오로 봐야 할 구간을 고른 뒤 시각 특징의 15.42%만 써서 면접 영상 1,891개에서 최고 수준 성능을 냈습니다. 사람의 선택적 주의를 본뜬 설계입니다.

뇌피셜 편집부· 2분 읽기원문 보기 ↗
마이크를 든 인터뷰 대상자를 카메라로 촬영하는 현장. 앞쪽에는 헤드폰을 쓴 음향 담당자가 앉아 소리를 듣고 있습니다.
사진: Starscream · CC BY-SA 3.0

핵심 답변

일본 JAIST 오카다 쇼고 교수와 박사과정 Hung Le 연구진이 Information Fusion에 발표한 EMF-dVAE는 사람이 대화 중 소리 변화를 먼저 알아차린 뒤 중요한 순간에만 시선을 돌리는 방식을 본떠, 오디오로 분석할 영상 구간을 고르고 나머지는 버립니다. 면접 영상 1,891개 데이터셋에서 시각 특징의 15.42%만 쓰고 최고 수준 성능을 냈고, 2분 영상당 처리 시간을 52초에서 18초로 약 65% 줄였습니다.

TL;DR세 줄 요약

  • 학습 때 오디오로 가릴 시각 구간을 정하고 복원하게 해, 모델이 과제에 정보가 많은 시각 영역을 스스로 배웁니다.
  • 추론 때는 중요한 시각 구간만 골라 오디오·전사 텍스트와 융합합니다.
  • ETS-Interview(260명, 2분 영상 1,891개)에서 시각 특징 15.42%만 쓰고 최고 수준 성능, 처리 시간 52초에서 18초.
  • 논문은 2026년 7월 11일 온라인 게재, 2027년 1월 1일 Information Fusion 137권 수록 예정입니다.

핵심 사실

보도자료
2026-08-05JAIST. 논문 온라인 게재 2026-07-11, DOI 10.1016/j.inffus.2026.104613
연구진
JAIST 오카다 쇼고 연구실제1저자 Hung Le, 공저자 Hung-Hsuan Huang, Candy Olivia Mawalim, Chee Wee Leong
모델
EMF-dVAE이산 변분 오토인코더 + 멀티모달 융합 네트워크
데이터셋
ETS-Interview260명, 2분 면접 영상 1,891개
시각 특징 사용률
15.42%약 85%는 버림
처리 시간
52초에서 18초2분 영상 1편 기준, 약 65% 단축

무슨 연구인가요

일본 호쿠리쿠첨단과학기술대학원대학(JAIST) 오카다 쇼고(Shogo Okada) 교수와 박사과정 Hung Le 연구진은 영상에서 봐야 할 순간만 골라 분석하는 AI 모델 EMF-dVAE(Efficient Multimodal Fusion with a discrete Variational Autoencoder)를 개발했습니다. 논문은 2026년 7월 11일 Information Fusion에 온라인 게재됐고, 2027년 1월 1일 137권에 실릴 예정입니다. JAIST는 8월 5일 보도자료를 냈습니다. 공식

출발점은 뇌와 인공신경망의 효율 차이입니다. 보도자료는 뇌가 효율적인 이유 하나로 "가장 관련 있는 정보에만 집중하고 과제에 따라 인지 노력을 배분하는 능력"을 꼽습니다. 반면 기존 AI는 정보가 거의 없는 프레임까지 전부 분석해 계산 비용이 늘고, 때로는 잡음이 섞여 정확도가 떨어집니다. 공식

바위 유적지에서 두 사람이 마주 서서 이야기를 나누는 모습
사람은 대화 상대를 계속 응시하지 않습니다. 연구진은 소리 변화를 먼저 알아차린 뒤 중요한 순간에만 시선을 옮기는 이 습관을 모델 설계로 옮겼습니다.· 사진: Vyacheslav Argenberg · CC BY 4.0

어떻게 작동하나요

EMF-dVAE의 처리 순서
  1. 오디오 분석

    소리 변화로 볼 가치가 있는 몇 초 구간 식별

  2. 시각 구간 선택

    선택된 구간만 시각 분석, 나머지 프레임은 무시

  3. 멀티모달 융합

    시각 특징을 오디오·전사 텍스트와 결합

  4. 최종 평가

    면접 영상 점수 예측

학습 단계에서 dVAE는 일부가 손상된 시각 데이터를 받는데, 어느 구간을 가릴지는 함께 들어온 오디오로 정합니다. 가려진 시각 정보를 복원하는 과정에서 모델은 과제에 정보가 많은 시각 영역이 어디인지 배웁니다. 추론 단계에서는 가장 중요한 시각 구간만 골라 오디오·언어 정보와 융합합니다. 공식 제1저자 Le는 사람이 대화할 때 상대를 계속 응시하지 않고 "먼저 소리 변화를 알아차린 뒤 중요하다고 느낀 순간에만 시선을 돌린다"고 비유했습니다. 공식

2분 면접 영상 한 편의 처리 시간
0초25초50초75초100초기존 방식EMF-dVAE52초18초
2분 면접 영상 한 편의 처리 시간
항목처리 시간
기존 방식52초
EMF-dVAE18초

출처: JAIST 보도자료 (2026-08-05). ETS-Interview 데이터셋 기준

성능은 ETS-Interview 데이터셋으로 검증했습니다. 260명이 찍은 2분짜리 면접 영상 1,891개입니다. 모델은 전체 시각 특징의 15.42%만 쓰고도 최고 수준의 성능을 냈고, 영상당 처리 시간은 52초에서 18초로 약 65% 줄었습니다. 시각 데이터의 85% 가까이를 버렸는데 오히려 더 빠르고 정확해진 것입니다. 연구진은 불필요한 프레임이 정보성 신호를 가리면서 계산 비용만 키우기 때문이라고 설명합니다. 공식

왜 '뇌와 AI'인가요

오카다 교수는 "뇌가 가장 관련 있는 순간에 주의를 집중하듯, 이 AI는 클립마다 분석할 영상 데이터 양을 자동으로 조절한다"고 말했습니다. 그는 영상이 지배적 데이터가 되는 상황에서 "모든 것을 봐야 하는 AI는 경제적으로도 환경적으로도 확장되지 않는다"며, 5~10년 안에 사람처럼 주의를 배분하는 AI가 면접 코치·튜터링·소통 지원 로봇을 일상 기기에서 돌아가게 할 수 있다고 내다봤습니다. 공식 연구비는 JSPS 과학연구비(26K03016), JST CREST(JPMJCR2563), JST CRONOS(JPMJCS24K7)가 지원했습니다. 공식

데이터센터 전산실에서 기술자가 노트북을 옆에 두고 서버 랙의 케이블을 손보는 모습
영상을 전부 분석하는 방식은 이런 계산 자원을 그만큼 더 씁니다. 오카다 교수는 모든 것을 봐야 하는 AI가 경제적으로도 환경적으로도 확장되지 않는다고 말했습니다.· 사진: Derrick Coetzee · CC0

자주 묻는 질문

정확도는 얼마나 올랐나요?
보도자료는 '최고 수준(state-of-the-art) 성능'이라고만 밝히고 구체적 수치는 적지 않았습니다. 불필요한 프레임이 잡음으로 작용하던 것을 제거해 더 빠르면서 더 정확해졌다는 설명입니다.
왜 소리로 고르나요?
제1저자 Le는 사람이 대화할 때 상대를 계속 응시하지 않고 소리 변화를 먼저 알아차린 뒤 중요한 순간에만 시선을 돌린다고 설명합니다. 모델도 오디오를 먼저 분석해 볼 가치가 있는 몇 초 구간을 고릅니다.
어디에 쓰이나요?
연구진은 면접 코치, 소통 훈련 도구, 튜터링 시스템, 소통 지원 로봇처럼 영상을 실시간으로 평가해야 하는 응용을 일상 기기에서 돌릴 수 있게 되기를 기대합니다.

출처 · 3

  1. 1AI Learns to Focus Like Humans to Speed Up Video Analysis (JAIST 보도자료, 2026-08-05)공식 발표www.jaist.ac.jp/english/whatsnew/press/2026/08/10-1.html
  2. 2Audio-guided visual selection for efficient multimodal fusion via a discrete variational autoencoder (Information Fusion, DOI)논문doi.org/10.1016/j.inffus.2026.104613
  3. 3Brain-Inspired AI Cuts Video Processing Time (Neuroscience News, 2026-08-05)보도neurosciencenews.com/ai-visual-processing-video-neurotech-31184/

이 글의 마크다운 원문: /brain/posts/audio-guided-visual-attention-ai/md/ · 인용 시 출처를 “뇌피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

뇌피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

뇌와 AI· 3

뇌 fMRI 신호로 LLM 추론 정확도를 13%p 올린 논문

베이징대 연구진이 사람이 논리 문제를 풀 때의 fMRI 신호로 LLM 내부 표현을 조정해 10개 모델의 추론 정확도를 올렸습니다. 방법·수치·한계를 정리합니다.

  • #뇌와 AI
  • #LLM
  • #fMRI