AMEET MEDIA|AMEET SPOT|AMEET TOON
AMEET MEDIA
오피셜
Hugging Face 인기 논문논문발표 2026.09.25 09:00 (KST)

베이징대·알리바바, 로봇용 공간음향 이해 모델 OmniEcho 공개

베이징대(Peking University) VaLuE-Lab과 알리바바 Token Hub, 칭화대(Tsinghua University) 연구진이 로봇 등 임바디드 에이전트가 소리의 방향과 위치를 듣고 시각 정보와 함께 판단하도록 만든 모델 OmniEcho와 이를 평가하는 벤치마크 OmniEchoBench를 발표했습니다. 논문은 arXiv에 공개됐고, 코드와 데이터는 GitHub 저장소(PKU-VaLuE-Lab/OmniEcho)에 추후 공개될 예정입니다.

  1. 1/로봇은 소리의 방향을 아직 잘 못 듣습니다

    사람은 소리가 어느 방향에서 나는지 듣고, 그 정보를 눈으로 보는 장면과 합쳐서 가려진 물체를 찾거나 시야 밖 상황을 파악할 수 있습니다. 하지만 로봇 같은 임바디드 에이전트(embodied agent)에게 이 능력은 아직 잘 다뤄지지 않았다고 연구진은 지적합니다. 연구진은 그 이유로 실제 환경에서 공간 음향 데이터를 모으는 비용이 크고, 시뮬레이션으로 만든 학습 데이터는 영상·이동 경로와 물리적으로 맞아떨어지게 만들기 어려우며, 기존의 옴니모달(음성·영상·언어를 함께 처리하는) 모델에 공간 음향을 어떻게 결합할지도 정해진 방법이 없다는 점을 들었습니다.

  2. 2/벤치마크와 모델을 함께 만들었습니다

    연구진은 먼저 OmniEchoBench라는 벤치마크를 만들었습니다. 이는 197개의 실제 공간 음향-영상 장면에서 나온 2,972개의 질의응답(QA) 쌍과, 30개의 실제 환경에서 수집한 FOA(First-Order Ambisonics, 방향 정보를 담은 4채널 오디오 방식) 음향 기반의 내비게이션 샘플 900개로 구성됩니다. 음향-영상 질의응답 데이터는 실제 배우가 대본에 따라 연기하며 1인칭 영상, 360도 파노라마 영상, FOA 오디오를 동시에 녹화해 만들었고, 소리 방향·3D 위치·소리 출처의 움직임·카메라 회전 등을 묻는 문제로 구성됩니다. 내비게이션 벤치마크는 30개의 실내 공간(단일 방 10개, 여러 방이 이어진 공간 20개)에서 조밀한 위치마다 소리를 녹음해 총 12,900개의 FOA 녹음을 모았고, 에이전트가 소리만 듣고 목표 지점을 찾아가도록 설계했습니다. 이와 별도로 대규모 학습 데이터를 만들기 위해 통제 가능한 공간 음향 렌더링 파이프라인을 개발해, 가상 장면에서 소리 발생 위치와 영상, 이동 경로가 기하학적으로 어긋나지 않도록 합성 데이터를 생성했습니다. 이렇게 만든 데이터로 학습시킨 모델이 OmniEcho이며, 알리바바의 Qwen3-Omni를 기반으로 FOA 전용 인코더를 추가하고, 기존에 학습된 일반 음성 처리 경로는 그대로 둔 채 공간 정보 처리 경로를 새로 붙이는 3단계 학습 절차를 적용했습니다.

  3. 3/공간 인지 과제에서 최고 성능, 내비게이션은 기존 방식에 근접

    논문은 OmniEcho가 OmniEchoBench의 공간 음향-영상 인지 과제에서 최고 성능(state-of-the-art)을 기록했다고 밝혔습니다. 소리로 목표를 찾아가는 내비게이션 과제에서는 텍스트 지시만으로 길을 찾는 기존 방식(vision-language navigation)의 성능에 근접하는 수준에 도달했다고 설명합니다. 다만 이 요약문에는 구체적인 정확도나 점수 수치, 비교 모델명이 표로 제시돼 있지 않으며, 논문은 기존의 다른 옴니모달 모델들은 이 벤치마크에서 어려움을 겪었다고만 서술합니다.

  4. 4/세밀한 위치·거리 추정은 여전히 어려운 과제

    연구진은 공간 음향이 임바디드 에이전트의 장면 이해와 내비게이션에 유용한 신호가 될 수 있음을 실험으로 보였다고 밝히면서도, 소리 발생 위치를 세밀하게 짚어내는 것과 거리를 추정하는 것은 여전히 풀리지 않은 중요한 과제로 남아 있다고 적었습니다. 또한 소리로만 목표를 찾아가는 내비게이션 과제는 기존의 텍스트 지시 기반 내비게이션보다 더 어렵다고도 설명했습니다.

  5. 5/임바디드 AI 연구에 공간 음향이라는 축이 더해집니다AMEET 해석

    그동안 로봇 내비게이션과 옴니모달 모델 연구는 영상과 언어 중심으로 발전해 왔고, 소리의 방향성은 상대적으로 덜 다뤄진 영역이었습니다. 이번 연구는 실제 환경에서 녹음한 FOA 데이터로 벤치마크를 만들고, 이를 학습할 수 있는 렌더링 파이프라인과 모델까지 함께 제시했다는 점에서 후속 연구자들이 바로 활용할 수 있는 도구를 마련한 셈입니다. 코드와 데이터가 예정대로 공개되면, 로봇이 카메라에 잡히지 않는 소리 출처를 찾아가는 능력을 검증하는 표준 시험대로 쓰일 가능성이 있습니다.

출처: Hugging Face 인기 논문 · 발표 2026.09.25 09:00 (KST)
원문 보기

댓글 0

첫 댓글을 남겨보세요.