文言文省Token:LLM编码是不是还有很大提升空间
用文言文或高效编码降低LLM Token消耗的探讨。
1. 关键信息
- 讨论围绕文言文及高效编码能否减少LLM Token消耗,本质是编码效率问题(#8)。
- 提出多embedding动态路由、隐空间Token接FC解码等技术方案(#1)。
- 训练数据差异影响performance,中文信息密度高有助于省Token(#2、#12)。
- Embedding的contrastive alignment至关重要,多链路Emb后需统一空间(#6)。
- 无关语言本身,可让LLM自行学习映射(#13)。
- 输出侧使用latent Token在L维度解码的设想(#14)。
- Adaptive tokenizer方向被提及(#16)。
- Vocabulary size与Token节省需权衡,极端情况每句话可一Token(#17)。
- Kolmogorov复杂度指出文言文代价是模糊性(#19)。
2. 羊毛/优惠信息
无
3. 最新动态
无
4. 争议或不同意见
- 文言文是否真省Token存在分歧,歧义可能降低准确率(#1、#17、#18)。
- 省Token依赖训练数据匹配,中文天然优势(#2、#12)。
- 有人认为无需语言载体,直接学映射即可(#13)。
- 对Embedding多链路与contrastive learning效果看法不一(#6)。
5. 行动建议
- 研究Adaptive tokenizer与contrastive learning结合。
- 探索隐空间Token与动态路由方案。
- 验证不同编码在特定任务上的Token效率与准确率权衡。