首页
学习
活动
专区
圈层
工具
发布
  • 您找到你想要的搜索结果了吗?
    是的
    没有找到

    Tokenizer 和 BPE

    举个简单的例子,中文“你好”在 UTF-8 中占 6 字节(\xe4\xbd\xa0\xe5\xa5\xbd),但 BPE 可能直接拆成两个汉字 ["你", "好"],无法处理字节级别的合并,如果训练语料只有英文...Byte-Level BPE 能够天然解决 OOV 问题,即使遇到训练数据中未出现的词(如新造词“栓Q”),Byte-Level BPE 也能拆解为字节组合: "栓Q" → UTF-8 字节 \xe6\xa0...\x93\x51 → 可拆分为 \xe6\xa0\x93(“栓”) + \x51(“Q”)。...2.2.3 Byte-Level BPE 的局限性 虽然 Byte-Level BPE 解决了 BPE 的许多问题,但仍有一些缺点: 可读性差:生成的 token 是字节序列(如 \xe4\xbd\xa0...合并对象:统计高频字节对(如 \xbd\xa0)。 词表扩展:从字节逐步合并为多字节 token(如 \xe4\xbd → \xe4\xbd\xa0)。

    63610
    领券