博主头像

大模型每个参数能记忆多少东西?| ICML 2026 | 3.6比特 | Transformer |

外来客 • 2026-08-18 00:56:30

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🧠 核心观点

  • 大模型参数并非硬盘式存储,而是同时包含对具体样本的“非预期记忆”与从数据中提炼的“泛化规律”。
  • 过去基于输出复现或成员推断的方法无法区分记忆与泛化,本文提出基于信息压缩的新框架,将记忆量化为模型对特定样本保留的比特数。
  • 记忆与泛化并非对立,而是随数据量变化动态转换:数据量小于模型容量时以记忆为主,超过容量后泛化能力主导。

📊 关键事实与论据

  • 容量量化:在 BF16 精度下,Transformer 模型平均每个参数约存储 3.64 比特信息;FP32 精度下约为 3.83 比特。该数值为特定架构与训练方法下的经验下限。
  • 实验设计:通过训练 50 万至 15 亿参数的模型处理均匀随机比特串,排除泛化变量,证实模型容量与参数量呈线性关系。
  • 相变现象:在真实文本(5M 数据集)实验中,当训练集大小超过模型容量临界点时,非预期记忆停止增长并下降,泛化能力快速上升。
  • 双下降解释:测试损失先降后升再降的“双下降”现象,恰好发生在数据量开始超过模型容量的临界点。
  • 成员推断风险:推断效果取决于模型容量与训练集大小的比值。稀有样本(如非英语文本、独特文档)比常见样本更容易被记住和识别,即使整体抽取率为零,成员推断仍可能有效。

🛡️ 结论

  • 3.6 比特/参数并非物理极限,而是当前技术下的容量下限,实际容量可能略高。
  • 数据隐私风险不能仅看模型规模,需关注数据的稀有度。独特、罕见的敏感数据(如内部文档、专有代码)被记忆和推断的风险显著高于通用语料。
  • 模型训练存在最优数据配比区间,数据量与模型容量匹配时效率最高,盲目增加数据量并不一定提升泛化能力。
  • 该研究为评估模型记忆、判断训练数据泄露风险提供了量化的理论依据和测量方法。

博主头像 👤 同一博主

查看该博主全部 61 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。