애플, 온디바이스 딕테이션 오디오 인코더 2.8배 압축

Apple ML Research가 9월 24일 09시(한국 시각, 00:00 UTC) 공개한 논문에서, 아이폰 등에서 완전히 기기 안에서 돌아가는 시스템 전반 딕테이션(System-wide Dictation)의 음성 인코더를 증류(distillation) 기법으로 2.8배 압축하는 방법을 제시했습니다. 이산 토큰이나 출력 분포가 아니라 양자화 직전의 잠재표현을 지도 신호로 삼은 것이 핵심입니다.
1/딕테이션 인코더가 왜 문제였나
애플의 시스템 전반 딕테이션은 전부 온디바이스에서 처리되며, 음성을 언어모델이 읽는 표현으로 바꿔주는 인코더(토크나이저)를 거칩니다. 이 언어모델은 Instruction-Following Pruning에 의해 희소하게 활성화되어 한 번에 일부 전문가(expert)만 DRAM에 올라오는데, 인코더는 항상 켜져 있어야 하므로 같은 메모리를 두고 경쟁하게 됩니다. 그 결과 인코더의 파라미터 수가 곧바로 전력과 지연시간에 영향을 줍니다. 이번 논문은 이 인코더를 증류로 압축하는 방법을 다룹니다.
2/무엇을 지도 신호로 삼았나
연구진은 이산 토큰이나 출력 분포 대신, 양자화기 직전의 잠재표현(pre-quantizer latent) - 언어모델이 실제로 읽는, 두 토큰 인터페이스가 공유하는 마지막 표현 - 을 목표로 삼았습니다. 학생(student) 인코더만 학습시켜 교사(teacher)의 프레임별 잠재표현을 제곱오차(squared-error) 목표로 회귀하도록 했고, 교사와 학생의 너비 차이는 아핀(affine) 레이어 하나로 흡수했습니다. 목표가 양자화와 언어모델 연결부보다 앞선 단계이기 때문에 하나의 레시피로 두 토큰 인터페이스를 모두 다룰 수 있고, 단독으로 사전학습된 인코더와 언어모델과 함께 학습된 인코더 양쪽에 모두 적용됩니다.
3/압축률과 정확도
2.8배 압축한 학생 모델은 여섯 개의 교사-학생 쌍 중 다섯 개에서 별도의 미세조정 없이도 교사 대비 상대 WER(단어 오류율) 차이를 1.9% 이내로 유지했습니다. 같은 용량으로 독립적으로 학습시킨 인코더와 비교하면 상대적으로 3.9% 개선됐습니다.
4/밝히지 않은 부분
원문은 여섯 쌍 중 다섯 쌍에서만 위 결과가 나왔다고 밝혔을 뿐, 나머지 한 쌍의 결과나 그 이유는 구체적으로 언급하지 않았습니다. 미세조정을 추가했을 때 결과가 어떻게 달라지는지도 논문에는 나와 있지 않습니다.
5/온디바이스 메모리 예산의 재배치AMEET 해석
이 연구는 애플이 온디바이스 AI에서 메모리 예산을 어떻게 나누는지를 보여줍니다. 언어모델은 희소 활성화로 DRAM 사용을 줄이는 대신, 상시 구동되는 오디오 인코더 쪽 크기를 줄여 전체 예산 안에서 전력과 지연시간 여유를 확보하려는 접근으로 읽힙니다.