애플 연구팀, 연합학습 음성인식 준지도 학습법 공개

애플 ML 리서치가 9월 24일 9시(한국 시각, 00:00 UTC), 라벨 없는 사용자 데이터로 연합학습(federated learning) 음성인식(ASR) 모델을 훈련할 때 생기는 성능 저하를 줄이는 방법을 담은 논문을 공개했습니다. 연구팀은 의사 라벨(pseudo-label)을 만드는 '교사' 모델과 서버가 라벨 있는 데이터로 계속 학습해 교사를 붙잡아 두는 '앵커' 방식을 함께 조정하면, 기존 최고 성능 기법보다 도메인 내에서 평균 20.8%, 도메인이 다른 경우 평균 10.0% 성능을 높일 수 있다고 밝혔습니다.
1/라벨 없는 기기 데이터로 음성인식을 학습시키는 문제
준지도 연합학습(semi-supervised federated learning, SSFL)은 각 기기(클라이언트)에 있는 라벨 없는 음성 데이터를 교사 모델이 만든 의사 라벨로 학습에 쓰고, 서버에는 소량의 라벨 있는 시드 데이터를 두는 방식입니다. 음성인식(ASR)에서는 의사 라벨의 오류가 문장 안에서, 그리고 학습 라운드를 거치며 계속 쌓여 결국 학습이 발산해 버리는 문제가 있어, 모든 데이터에 라벨을 준 완전지도 연합학습과의 성능 격차가 큽니다. 이 논문은 이 격차를 줄이는 실용적인 방법을 제시합니다.
2/의사 라벨을 누가 만들고, 서버가 어떻게 붙잡아 두나
연구팀은 각 클라이언트 자신의 진화하는 모델이 라벨을 만드는 '온라인 교사'와, 라운드마다 고정된 하나의 서버 모델이 라벨을 만드는 '브로드캐스트 전역 교사'를 비교했습니다. 온라인 교사는 혼자서는 발산하지만, 안정화 장치를 붙이면 도메인이 같을 때는 전역 교사를 확실히 앞서고 도메인이 다를 때도 비슷하거나 나은 성능을 냅니다. 시드 데이터가 풍부해질수록 온라인 교사의 이점은 줄어드는데, 이때는 초반에는 전역 교사를 쓰다가 특정 라운드부터 온라인 교사로 바꾸는 '전환 교사'가 둘 다를 앞섭니다. 안정화의 핵심은 서버가 라운드 사이사이 라벨 데이터로 계속 학습을 이어가는 것으로, 이를 멈추면 온라인 교사가 흐트러지며, 이 학습 개입 방식이 시드 모델 선택보다 수렴에 더 큰 영향을 준다고 설명합니다.
3/11개 조합 중 9개에서 기존 최고 기법을 앞섬
이 방법은 11개 도메인 조합 중 9개에서 기존에 가장 좋았던 방법보다 나은 성능을 냈습니다. 같은 도메인 안에서는 평균 20.8%, 도메인이 다른 경우에는 평균 10.0% 성능이 개선됐고, 이를 통해 완전지도 연합학습과의 격차를 좁혔다고 밝혔습니다.
4/안정화 정도는 도메인마다 다르게 맞춰야
얼마나 강하게 안정화해야 하는지는 도메인에 따라 달라지며, 이는 시드 데이터가 얼마나 흩어져 있는지와 클라이언트 데이터와 얼마나 겹치는지에 좌우된다고 논문은 설명합니다. 또한 안정화 효과는 데이터 증강(augmentation)과 배치 크기 설정에 민감한데, 이 두 설정이 서버가 학습에 주입하는 입력·기울기 노이즈의 양을 좌우하기 때문입니다. 즉 교사 선택을 공격적으로 해도 이 안정화 설정이 맞지 않으면 이득을 보지 못한다고 밝혔습니다.
5/기기 데이터를 서버로 모으지 않고도 인식 품질을 높이는 길AMEET 해석
이번 연구는 사용자 음성 데이터를 중앙 서버로 모으지 않고도, 연합학습만으로 음성인식 품질을 완전지도 학습에 가깝게 끌어올릴 수 있는 실마리를 제시합니다. 다만 논문에 나온 교사·앵커 조합과 증강·배치 크기 설정은 실험한 도메인 조건에서 얻은 결과이므로, 다른 서비스에 그대로 적용하려면 각자의 시드 데이터와 클라이언트 데이터 특성에 맞춰 다시 조정하는 과정이 필요해 보입니다.