Skip to content
所有標籤

#bpe

3 篇文章
ai deep-dive 認識 AI 模型

Tokenization:BPE 演算法,以及為什麼中文比英文貴

模型不是按字數收費,是按 token 收費。BPE 演算法從字元開始,反覆合併最常出現的相鄰配對來建詞表。英文 'understanding' 可能是 1-2 個 token,但中文「理解」可能要 2-3 個——同樣的意思,中文就是比較貴。

CS224N 第 14 講:Tokenization 如何製造多語言成本差

第 14 講從 word、character/byte 與 subword 切分一路走到 BPE failure cases 和跨語言公平:tokenizer 決定序列長度、運算成本與模型看到的語言單位,因此不是中立前處理。

CS336 Lecture 1:從位元組到 tokenizer,先決定什麼值得隨規模成長

CS336 第一講不把「從零打造語言模型」理解成重做所有舊技術,而是先區分 mechanics、mindset 與 intuitions,再用 BPE 示範如何把原始位元組轉成可訓練的 token。