Dukumeenti

Hagayaasha bilowga degdegga ah

Soo rar xogta, u qor hadalka, oo orod tokenizer-ka Soomaaliga.

Dhammaan xogta iyo moodellada waxaa lagu hayaa Hugging Face ee ururka goobolabs. Ku rakib: pip install datasets transformers.

Soo rar xog
from datasets import load_dataset

# Load the Somali text corpus
ds = load_dataset("goobolabs/somnlp-corpus")
print(ds["train"][0])
# {'text': 'Waxaan jeclahay barashada...', 'domain': 'news', 'dialect': 'standard'}
U qor hadalka Soomaaliga (ASR)
import whisper

model = whisper.load_model("goobolabs/whisper-som-small")
result = model.transcribe("audio.wav", language="so")
print(result["text"])
# 'Beeraha Soomaaliya waxay u baahan yihiin...'
Tokenize qoraalka Soomaaliga
from transformers import AutoTokenizer

tok = AutoTokenizer.from_pretrained("goobolabs/goobo-tokenizer")
tokens = tok.tokenize("Caafimaadka carruurtu waa mudnaanteenna koowaad.")
print(tokens)
# ['Caafimaad', '##ka', 'carruur', '##tu', 'waa', ...]

Su'aalaha badanaa la weydiiyo

Kaydadka xogta iyo moodelladu ma bilaash bay yihiin?

Haa — wax walbaba halkan waxay si furan ugu jiraan Hugging Face ee hoos yimaada ururka goobolabs. Shuruudaha layisenska way ku kala duwan yihiin sii-dayn kasta, marka hubi layiseenka ku qoran kayd kasta ama moodel kasta ka hor inta aadan isticmaalin adeeg dhab ah.

Moodellada hadda diyaarka ah waa kuwee?

whisper-som-small ee aqoonsiga hadalka, goobo-tokenizer ee kala-goynta erayada Soomaaliga oo dhaqan ka mid ah, iyo som-en-mt ee tarjumaadda Soomaali–Ingiriisi — eeg qaybta Moodellada faahfaahin dheeraad ah.

Sideen moodel ugu qiimeeyaa SomBench?

SomBench v0.1 waa baaxadda qiimeynta furan ee Soomaaliga — eeg qaybta Halbeegyada (Benchmarks) bidix-dhinaca si aad u aragto liiska hadda iyo sida loo soo gudbiyo natiijooyinka.

Wargeyska

La soco wararka

Sii daynta xogta, kooxo bootcamp cusub, waraaqo cilmi-baaris, iyo cusboonaysiinta shaybaarka — toos ugu socda sanduuqaaga. Spam ma jiro, waad ka bixi kartaa markasta.