goobolabs/somnlp-stt-corpus
Hadalka Soomaaliga oo la qoray oo leh isku-duwid heerka erayga, laga soo qaatay raadiyo iyo qaybo la akhriyay, oo loogu talagalay tababarka ASR.
Ka eeg Hugging FaceNooca
Hadalka
Cabbirka
320 hours · 48 GB
Shatiga
CC-BY-4.0
Luqadda
Soomaali (af)
Qaabka
MP3 + Parquet
Nooca (version)
v1.2
Hawlaha
ASR, Speaker ID, VAD
Goobaha
Raadiyo · Hadalka la akhriyay · Waraysiyo
| Qayb | Safafka | Cabbirka |
|---|---|---|
| train | 12,800 clips | 43.1 GB |
| dev | 640 clips | 2.4 GB |
| test | 640 clips | 2.5 GB |
from datasets import load_dataset
ds = load_dataset("goobolabs/somnlp-stt-corpus", "clean")
sample = ds["train"][0]
print(sample)@dataset{somnlp_stt_2026,
title = {SomNLP-STT-Corpus: Somali Speech Dataset},
author = {Goobo Labs},
year = {2026},
url = {https://huggingface.co/datasets/goobolabs/somnlp-stt-corpus}
}