Snapwre Releases First Open Amharic Speech Dataset on Hugging Face… — Web 3.0 Ethiopia - DeFi & AI — TG.ME

Snapwre Releases First Open Amharic Speech Dataset on Hugging Face

Snapwre has officially launched its first open-source Amharic speech dataset on the Hugging Face platform, featuring 22.7 hours of audio comprised of 7,405 clips from 320 distinct speakers. Licensed under the permissive CC BY 4.0, the dataset is available for free use in Automatic Speech Recognition (ASR) research and applications. The data was entirely crowdsourced from Ethiopian volunteers using a dedicated Telegram bot and peer validation system.

ስናፕዌር (Snapwre) 22.7 ሰዓታት የሚረዝም እና ከ320 የተለያዩ ሰዎች የተቀዳ 7,405 የድምፅ ቅጂዎችን (clips) የያዘ የመጀመሪያውን የአማርኛ የድምፅ መረጃ ስብስብ (dataset) በ"ሀጊንግ ፌስ" (Hugging Face) መድረክ ላይ ይፋ አድርጓል። "CC BY 4.0" በተባለ የነፃ የፈቃድ አይነት የተለቀቀው ይህ መረጃ፣ ለማንኛውም የድምፅ ወደ ጽሑፍ (ASR) ትንተና ስራዎች እና ምርምሮች በነፃ ማገልገል ይችላል። መረጃው ሙሉ በሙሉ የተሰበሰበው በቴሌግራም ቦት አማካኝነት በፈቃደኛ ኢትዮጵያውያን ሲሆን፣ የቅጂዎቹ ትክክለኛነትም በማህበረሰቡ አባላት የተረጋገጠ ነው።

https://huggingface.co/datasets/snapwre/amharic-speech

@webthreeth
🔥3
August 27, 2026 92 2