缩放法则
缩放法则(Scaling Laws)是近年来大模型领域最重要的发现之一。它揭示了模型性能与模型参数量、训练数据量及计算量三个因素之间存在着可预测的幂律关系。这一发现为大模型的早期发展提供了理论指导——在资源允许情况下,尽可能扩大参数、训练数据。
在2022年,DeepMind提出 Chinchilla定律:模型参数量与训练数据量存在一个最优配比,70B Chinchilla模型使用多于GPT-3(175B)模型4倍的训练数据量,实现了性能的超越。这一发现纠正了“模型越大越好”的片面认知。
[!IMPORTANT]
缩放法则最令人惊奇的产物是能力涌现——当模型规模达到一定阈值后,会突然展现出在小模型不存在的能力,如链式思考(Chain of Thought)、指令遵循(Instruction Following)等。
模型幻觉
模型幻觉(Hallucination)指的是大模型生成的内容与客观事实、用户输入或上下文信息矛盾。幻觉的本质是模型在生成过程中的过度自信,而非准确的检索或者推理。
幻觉的类型包括:
- 事实性幻觉:模型生成信息与现实生活不符。
- 忠实性幻觉:在文本摘要、翻译等任务中,模型生成的内容未能忠实的反应上下文文本的含义。
- 内在幻觉:模型生成的内容与输入的信息矛盾。
幻觉产生的原因主要包括:
- 首先,训练数据中存在错误的信息。
- 其次,模型的自回归机制决定了它只是在预测下一个最可能的词元,而没有内置的事实核查模块
- 最后,面对复杂的任务,模型可能会在逻辑链条中出错。
解决幻觉的方法:
- 数据层面:高质量清洗数据、引入事实性知识、通过模型后训练等从源头解决模型的幻觉。
- 模型层面:探索新的模型架构,解决模型输出过程中的不确定性。
- 推理与生成层面:
- 检索增强生成(Retrieval-Augmented Generation,RAG):通过在生成之前引入外部知识库中检索到的相关信息,来引导模型生成基于事实的回答。
- 多步推理与验证:引导模型多步推理,并在每一步进行自检或者外部检查。
- 引入外部工具:允许模型调用外部工具(计算器、搜索引擎、代码解释器)等来实时获取信息或进行正确性诊断。