首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >AI 幻觉 >大模型的上下文窗口大小对幻觉有何影响?

大模型的上下文窗口大小对幻觉有何影响?

词条归属:AI 幻觉

1. 上下文腐烂现象

上下文腐烂(Context Rot)指随着输入上下文变长,LLM 在准确率、指令遵循和引用忠实度上逐渐下降的现象。来自 Chroma、Anthropic 和 Databricks 的评测一致显示,同一模型在相同任务上准确率从 8K 时的 95% 跌到 64K 时的约 60%。Google 官方技术文件披露,同一模型在 MRCR 测试中,128K 上下文得分 84.9%,而 1M 上下文骤降至 26.3%。

2. "迷失在中间"效应

斯坦福研究证实 LLM 对上下文的注意力呈 U 形曲线——开头和结尾的信息获得 70% 至 75% 的准确率,而中间部分跌至 55% 至 60%。在 20 份文档的多文档问答中,当相关文档位于第 5 至 15 位时,准确率比位于第 1 或第 20 位时下降超过 30%。这意味着防止幻觉的关键事实如果恰好位于长提示的中间位置,模型可能实际上"看不到"它。

3. 注意力稀释机制

Transformer 自注意力的计算量随序列长度呈二次方增长。在 10K token 时模型追踪 1 亿对关系,100K 时增至 100 亿,1M 时高达 1 万亿。Softmax 注意力在所有 token 间归一化权重,随着分母增大,每个 token 获得的注意力成比例减少。10 倍上下文增长意味着每个 token 的注意力减少 10 倍——这不是模型"忽略"了代码,而是在物理上无法同等强度地关注它。

4. 干扰物效应

Chroma 的研究分离出第三种机制——干扰物干扰。添加语义相似但不相关的内容造成的退化超出上下文长度本身的解释。与查询主题相关但事实上无关的干扰物在幻觉回答中出现频率最高。代码搜索是最坏情况:当编码 agent 搜索 webhook 处理器时,上下文中充斥着测试夹具、废弃实现、模拟对象和命名相似的函数,每一个都语义接近但事实无关。

相关文章
深度学习中的batch大小对学习效果有何影响?
Batch_Size(批尺寸)是机器学习中一个重要参数,涉及诸多矛盾,下面逐一展开。
BBuf
2020-03-05
2K0
什么是大语言模型的上下文窗口
在大语言模型的使用中,“支持 32k 上下文”的意思是该模型可以处理并记住最多 32,000 个标记(tokens)的输入。这些标记通常是文本的最小组成部分,可以是一个字符、一个单词,或一个词组的部分。大多数自然语言处理模型并不是直接处理字符或单词,而是将它们分解成标记,用以更高效地进行理解和生成。这种方式允许模型更加灵活地应对不同长度的文本和复杂的语义结构。
编程小妖女
2026-03-07
5880
Google新研究:降低大模型幻觉的全新视角——充分上下文!
检索增强生成(RAG)因为能够有效控制大模型幻觉问题已成为当前LLM应用最热门的技术模式,利用一些编排框架可以快速构建一个知识问答类的原型应用。然而,令人沮丧的是,即使使用了RAG,构建了可信的知识库,但大模型仍然会因为上下文不准确,错乱,不完整等原因给出错误的答案。这些“幻觉”和不可靠性问题,正是阻碍当下AI应用难以真正上生产的拦路虎问题。
用户11563501
2026-06-23
1490
AI System AI系统对大模型的影响有多深?
AI System AI系统对大模型的影响有多深?要回答这个问题之前,不妨从下面这个问题开始入手思考。
ZOMI酱
2024-04-21
5811
Java 12的性能优化对不同规模和类型的应用程序有何影响?
Java 12 的性能优化主要围绕垃圾回收、JIT 编译和基础库效率展开,这些改进对不同规模和类型的应用程序影响各异,具体如下:
搜罗万相
2025-10-15
2810
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券