Hagayaasha bilowga degdegga ah
Soo rar xogta, u qor hadalka, oo orod tokenizer-ka Soomaaliga.
Dhammaan xogta iyo moodellada waxaa lagu hayaa Hugging Face ee ururka goobolabs. Ku rakib: pip install datasets transformers.
from datasets import load_dataset
# Load the Somali text corpus
ds = load_dataset("goobolabs/somnlp-corpus")
print(ds["train"][0])
# {'text': 'Waxaan jeclahay barashada...', 'domain': 'news', 'dialect': 'standard'}import whisper
model = whisper.load_model("goobolabs/whisper-som-small")
result = model.transcribe("audio.wav", language="so")
print(result["text"])
# 'Beeraha Soomaaliya waxay u baahan yihiin...'from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("goobolabs/goobo-tokenizer")
tokens = tok.tokenize("Caafimaadka carruurtu waa mudnaanteenna koowaad.")
print(tokens)
# ['Caafimaad', '##ka', 'carruur', '##tu', 'waa', ...]Su'aalaha badanaa la weydiiyo
Kaydadka xogta iyo moodelladu ma bilaash bay yihiin?
Haa — wax walbaba halkan waxay si furan ugu jiraan Hugging Face ee hoos yimaada ururka goobolabs. Shuruudaha layisenska way ku kala duwan yihiin sii-dayn kasta, marka hubi layiseenka ku qoran kayd kasta ama moodel kasta ka hor inta aadan isticmaalin adeeg dhab ah.
Moodellada hadda diyaarka ah waa kuwee?
whisper-som-small ee aqoonsiga hadalka, goobo-tokenizer ee kala-goynta erayada Soomaaliga oo dhaqan ka mid ah, iyo som-en-mt ee tarjumaadda Soomaali–Ingiriisi — eeg qaybta Moodellada faahfaahin dheeraad ah.
Sideen moodel ugu qiimeeyaa SomBench?
SomBench v0.1 waa baaxadda qiimeynta furan ee Soomaaliga — eeg qaybta Halbeegyada (Benchmarks) bidix-dhinaca si aad u aragto liiska hadda iyo sida loo soo gudbiyo natiijooyinka.
La soco wararka
Sii daynta xogta, kooxo bootcamp cusub, waraaqo cilmi-baaris, iyo cusboonaysiinta shaybaarka — toos ugu socda sanduuqaaga. Spam ma jiro, waad ka bixi kartaa markasta.