goobolabs/somnlp-corpus
Corpus-ka qoraalka Soomaaliga ee furan ee ugu weyn — 887M+ tokens oo ka yimid 6 ilo sare (HPLT · CC100 · mC4 · OPUS · MADLAD · MT560), oo lagu nadiifiyay pipeline lix-marxaladood ah.
Ka eeg Hugging FaceNooca
Qoraal
Cabbirka
887M+ tokens · 4.5 GB
Shatiga
CC-BY-4.0
Luqadda
Soomaali (af)
Qaabka
Parquet / JSONL
Nooca (version)
v2.0
Hawlaha
LM, NER, POS, Classification
Goobaha
HPLT · CC100 · mC4 · OPUS · MADLAD · MT560
| Qayb | Safafka | Cabbirka |
|---|---|---|
| train | 1,686,146 | 4.3 GB |
| validation | 44,372 | 115 MB |
| test | 44,373 | 115 MB |
from datasets import load_dataset
ds = load_dataset("goobolabs/somnlp-corpus")
sample = ds["train"][0]
print(sample)@dataset{somnlp_corpus_2026,
title = {SomNLP-Corpus: Open Somali Text Corpus},
author = {Goobo Labs},
year = {2026},
version = {2.0},
license = {CC-BY-4.0},
url = {https://huggingface.co/datasets/goobolabs/somnlp-corpus}
}