Gaze-VLM: Bridging Gaze and VLMs via AttentionRegularization for Egocentric Understanding
·
ML&DL/논문리뷰
Abstract해당 논문은 사람의 시선 정보가 1인칭 시점 영상 이해에 도움이 된다는 점을 보여준다. 사람은 행동하기 전에 관련 물체를 먼저 바라보는 경우가 많기에, 시선은 사용자의 주의, 단기적 의도, 미래 행동을 예측하는 중요한 단서가 된다. 그리해 논문은 VLM이 사람처럼 중요한 영역에 주목하도록 gaze-regularized attention 방식을 제안한다. 기존 연구는 이미지와 같은 시각 입력에만 의존하거나 시선 정보를 모델의 보조 입력으로 활용한 것과 달리, 이 논문은 시선 정보를 학습 단계에서만 사용한다. 따라서 실제 추론 단계에서는 시선 데이터 없이 영상 입력만으로 동작할 수 있다는 점이 핵심이다. 또한 gaze-regularized attention 방식은 특정 모델 구조에만 제한되지 ..