MEGA Hub

Easper: An Accessible ASR Pipeline for Language Documentation

Authors

Do you know Aso Mahmudi?You can claim authorship or link another user.Do you know Ting Dang?You can claim authorship or link another user.Do you know Ekaterina Vylomova?You can claim authorship or link another user.Do you know Nick Thieberger?You can claim authorship or link another user.

Abstract

Audio transcription is a critical bottleneck in language documentation. While multilingual Automatic Speech Recognition (ASR) models like Whisper offer solutions, field linguists often lack the expertise to utilise them. We present Easper, an open-source, no-code workflow enabling linguists to iteratively fine-tune ASR models via cloud resources directly from ELAN annotations. Deploying ASR also raises a cold start problem: deciding which recordings to transcribe first to bootstrap an accurate model. Using Easper, we evaluate transcription prioritisation strategies on three Vanuatu languages (Bislama, Nafsan, Nguna). We fine-tune models by recording session, comparing Character Error Rate trajectories when prioritising acoustic cleanliness versus linguistic richness. We demonstrate that prioritising lexically rich narratives and increasing acoustic-phonetic repetition, even in noisy environments, leads to faster improvements in transcription quality.

Community

00

Publication notes

Author note
Accepted in Interspeech 2026