大模型每个参数能记忆多少东西?| ICML 2026 | 3.6比特 | Transformer |
外来客 • 2026-08-18 00:56:30
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🧠 核心观点
- 大模型参数并非硬盘式存储,而是同时包含对具体样本的“非预期记忆”与从数据中提炼的“泛化规律”。
- 过去基于输出复现或成员推断的方法无法区分记忆与泛化,本文提出基于信息压缩的新框架,将记忆量化为模型对特定样本保留的比特数。
- 记忆与泛化并非对立,而是随数据量变化动态转换:数据量小于模型容量时以记忆为主,超过容量后泛化能力主导。
📊 关键事实与论据
- 容量量化:在 BF16 精度下,Transformer 模型平均每个参数约存储 3.64 比特信息;FP32 精度下约为 3.83 比特。该数值为特定架构与训练方法下的经验下限。
- 实验设计:通过训练 50 万至 15 亿参数的模型处理均匀随机比特串,排除泛化变量,证实模型容量与参数量呈线性关系。
- 相变现象:在真实文本(5M 数据集)实验中,当训练集大小超过模型容量临界点时,非预期记忆停止增长并下降,泛化能力快速上升。
- 双下降解释:测试损失先降后升再降的“双下降”现象,恰好发生在数据量开始超过模型容量的临界点。
- 成员推断风险:推断效果取决于模型容量与训练集大小的比值。稀有样本(如非英语文本、独特文档)比常见样本更容易被记住和识别,即使整体抽取率为零,成员推断仍可能有效。
🛡️ 结论
- 3.6 比特/参数并非物理极限,而是当前技术下的容量下限,实际容量可能略高。
- 数据隐私风险不能仅看模型规模,需关注数据的稀有度。独特、罕见的敏感数据(如内部文档、专有代码)被记忆和推断的风险显著高于通用语料。
- 模型训练存在最优数据配比区间,数据量与模型容量匹配时效率最高,盲目增加数据量并不一定提升泛化能力。
- 该研究为评估模型记忆、判断训练数据泄露风险提供了量化的理论依据和测量方法。
👤 同一博主
如何从专有LLM API中窃取推理痕迹 | LLM安全 | 推理痕迹 | 大语言模型 | AI安全
李飞飞发布最新世界模型Atlas | World Labs | 世界模型 | 3D重建 | 视频生成
动荡时代来临,比尔盖茨发出AI警告 | AI风险 | 人工智能 | AI治理 | 就业冲击 | 人类
RSI推进越快,OpenAI的IPO越迟 | Sam Altman | OpenAI | RSI递归
OpenAI Astra循环深度架构:大模型第三条Scaling法则 | OpenAI Astra
SHEIN:千亿独角兽能否老树开新花 | 希音 | 跨境电商 | 快时尚 | 小单快反 | 港股IP
GPT-6 Astra:OpenAI宣布进入AGI时代 | OpenAI | GPT-6 | Ast
RoR之父:不要预测任何事 | DHH | Ruby on Rails | AI编程 | Agent
AI Agent时代的FinOps:谁花光了所有Token | FinOps | AI Agent
Fable 5.1来了:缓存降价75%却未必更省钱 | Claude Fable 5.1 | Ant
🧭 类似博主
0 条评论
发表评论
请先 登录 后参与讨论。