不是让模型背更多公式,而是让它读懂当前上下文:为长文本推理,构造可训练、可评测的 ICL 数据。
上下文不只是把长文本塞进去那么简单。它关乎模型如何理解、记忆并利用信息,这才是拉开应用差距的关键。
长上下文不是越长越好。关键信息如果被埋在中间,模型很容易忽略,也就是 Lost in the Middle;竞争点在于能否精准定位和理解关键信息。
长任务需要任务状态管理,而不是无限拉长上下文;模型需要持续知道当前目标、已完成动作和待办事项。
部分技能也应被内化为稳定的条件反射式能力。
物理题天然适合训练这类能力:答案明确,但必须服从当前材料中的定义、边界、规范、sector 与符号约定。
Context Faithful · Object Selection · Verifiable
覆盖结构控制单一理论方向占比,补足量子、凝聚态、数值、实验与数学物理,让数据能测到真实科研阅读中的多种失败机制。
覆盖不是堆方向——每个方向都对应一类真实的 ICL 失败机制:定义漂移、物理对象选错、多 sector 漏项、branch 走错。
合计 100 道物理长文本 ICL 样本 · 每条均带论文式 context、标准解、评分点与多模型运行记录。
这套数据面向现有 benchmark 暴露的共同缺口——模型在短题式科学问答进步很快,但在论文式 context、物理对象选择、跨段落证据装配与稳定推理上仍不可靠。
同一 context、同一 prompt、同一专家 Rubric。每个模型独立运行三次,按 0–10 分取平均,并由专家复核关键失分位置。
六道样例满分 10,均分集中在 1.3 – 4.5——即便最强模型也远未及格。分数用于展示稳定表现区间;完整记录含每次运行原文、逐项评分与专家复核。
卡住模型的不是式子长,而是要在 ODE、residual coefficient、affine cutoff 与指数幂之间保持定义一致——每个量都由当前 context 定义。
模型能识别 Hadamard 结构,却常漏掉 1/4 因子或写反 sector 符号——保真度失败,而非不懂变换。
不只记录模型答对没有,更刻画它如何在给定材料中读取定义、选择物理对象、装配中间量——开箱即用,可直接接入训练 / 评测管线。
真正有价值的科学数据,应当可训练、可评测、可复核、可追错。告诉我们您的训练 / 评测方向,我们将快速组建对口的物理 ICL 数据与评测管线。
告诉我们你的训练 / 评测方向,我们给出对口的物理 ICL 数据与评测管线。