Skip to content
所有標籤

#multilingual

2 篇文章

國家隊的從零訓練:Apertus 的合規路線與 LLM-jp 的日文生態

兩個國家級專案展示了從零訓練的另一種動機:瑞士的 Apertus 用 15T tokens、1,000+ 語言與嚴格的 opt-out 個資過濾對齊 EU AI Act;日本的 LLM-jp 由 NII 主導,2026 年 4 月的 LLM-jp-4 在 12T tokens 上訓練出多項 benchmark 超越 GPT-4o 的模型。它們回答的問題和效能路線不同:不是「跑得快」,而是「主權與合規下能訓出什麼」。

aiguideRAG 技法大全

BGE-M3:為什麼這個 Embedding 模型適合繁體中文 RAG

Embedding 模型的選擇直接影響 RAG 的搜尋品質。BGE-M3 的多語言訓練、1024 維向量、同系列 Reranker,是繁中 RAG 的實用選擇。