一,羅馬字粵語Base模型Cantonese-Qwen3-8B-Base

粵語原生大模型 Liujgoj V3 正式登陸 Hugging Face!
打破漢字(Hanzi)束縛,邁向 Speech-native 嘅關鍵一步! 基於 Qwen3-8B-Base,我完成了 3 個 Epoch 嘅 LoRA 增量預訓練(CPT),最終 Train Loss 漂亮收斂至 1.5951!

呢個模型有咩咁特別?
1️⃣ 獨立拉丁正字系統:Liujgoj(溜歌)唔係普通拼音,而係一套音位結構確定(Deterministic)嘅獨立拉丁化正書法。
2. 極致口語大腦:灌入 60+ 部香港經典電影全文本對白,融合認知語言學語義模型,模型內化咗極其道地嘅粵語語感與句尾助詞(SFP)。
3️⃣ 文字續寫爆發:喺無對齊模板下,對溜歌正詞法嘅內在概率分佈極其敏銳,完美遵循 -r 韻尾與 -j/-x/-q 聲調編碼!

鏈接:https://huggingface.co/Yvthyvq



二,羅馬字粵語多任務 Instruct 大模型cantonese-qwen3-8b-instruct


全新【Liujgoj 溜歌粵語Instruct 大模型】正式發佈!基於 Qwen3-8B 深度微調,擺脫漢字束縛,採用純語音導向(Phonology-first)嘅拉丁化正詞法。結合地道香港電影與口語指令對,為下一代語音原生(Speech-native) AI 奠定文本底座!

https://huggingface.co/Yvthyvq/cantonese-qwen3-8b-instruct


三,Liujgoj-Cantonese-Qwen3.5-9b-Base

Liujgoj-Cantonese-Qwen3.5-9b-Base 是一個基於 Qwen3.5-9B 進行擴充詞表與增量預訓練(Continued Pre-training, CPT)的廣東話/粵語大語言模型基座。
https://huggingface.co/Yvthyvq/Liujgoj-Cantonese-Qwen3.5-9b-Base


四,Liujgoj-Cantonese-Qwen3.5-9B-ASR (LoRA)

本模型是專為 Liujgoj 廣東話拉丁化拼音方案 打造的語音轉寫(ASR)文本精調補丁(LoRA)。
https://huggingface.co/Yvthyvq/Liujgoj-Qwen3.5-9b-ASR-lora