Article Intelligence
先看结论
新框架 [schema] 在 ARC-AGI-3 公开测试集上使用 Opus 4.8 + Fable 5 达到 99% RHAE,使用 GPT-5.6 Sol 达到 95.35% RHAE,核心理念是让 LLM 像物理学家一样思考。
核心指标
评分用于衡量信号强度,判断类指标用于解释方向、热度、后续动作与可信程度。
影响力
衡量事件对技术、产业或生态的外部影响强度。
2.5
该事件为一则社交媒体短帖(X/Twitter),声称新框架 [schema] 在 ARC-AGI-3 上达到 99% RHAE。评分依据如下:(1) 消息源仅为个人 X 账号,无论文、无代码、无技术细节,完全不可复现验证;(2) 模型名 'Opus 4.8'、'Fable 5'、'GPT-5.6 Sol' 非常规命名,'RHAE' 也非 ARC 基准的已知标准指标,引入自创指标而无定义是典型 PR 手法;(3) 认识论状态已被标注为 pr_statement,属于宣传性陈述;(4) 若属实本应为范式级影响(10分),但以当前呈现形式,对行业实质冲击力接近于零。
复合价值
综合新颖性、可执行性与长期观察价值。
7.5
从 VC 视角看,[schema] 在 ARC-AGI-3 上达到 99% 的分数本身就是强信号——ARC-AGI 系列以泛化推理难度著称,此前很少有框架能接近这个水平。核心价值在于它定义了一个模型无关的推理层('像物理学家一样思考'),这是一种元认知范式,不同于 Chain-of-Thought 或 Tree-of-Thought 等结构化提示技巧。如果这一范式可跨模型、跨任务泛化,它将成为一个独立的推理基础设施层,具备长期复利效应(模型迭代,但推理框架积累方法和数据飞轮)。但风险同样显著:目前仅有一个 X 帖子作为证据,无代码、无论文、无可复现结果,99% 的高分在成熟基准上需要独立验证。此外,'think like a physicist' 是否能在更广泛任务上推广仍存疑。综合来看,有成为新推理范式基石的潜力,但目前尚处于'需严格验证'阶段,给 7.5 分。
结构化事实、实体识别与逻辑链
新框架 [schema] 在 ARC-AGI-3 公开测试集上使用 Opus 4.8 + Fable 5 达到 99% RHAE,使用 GPT-5.6 Sol 达到 95.35% RHAE,核心理念是让 LLM 像物理学家一样思考。
作者 havenfeng 在 X 平台上发布了一个名为 [schema] 的新框架(harness),该框架旨在让大语言模型像物理学家一样推理。根据公告数据,[schema] 在 ARC-AGI-3 Public 测试集上,搭配 Opus 4.8 和 Fable 5 模型实现了 99% 的 RHAE 分数,搭配 GPT-5.6 Sol 模型实现了 95.35% 的 RHAE 分数。
情绪
中性
更像事实更新或研究记录,情绪不强;按影响力和复合价值决定阅读深度。
Hype
高 hype
宣传或概念成分较高,先验证证据,再决定是否投入时间。
严重的概念炒作预警。'99% RHAE' 是一个极高的分数,瞄准 ARC-AGI 这一具有标杆意义的基准,但全文仅两句话,无任何方法论、架构图、消融实验或代码链接。使用非标准指标 'RHAE' 而非 ARC 常规的 accuracy/pass@k,模糊了对比基准。'像物理学家一样思考' 是典型 PR 修辞,无具体技术落脚点。整体呈现出 benchmark-washing 的特征。
行动建议
前瞻关注
前瞻性强但不确定,适合放入观察清单,不急于行动。
置信度
分别对应影响力、复合价值与 Hype 判断的可信程度。
技术/商业影响、关注焦点与受影响对象
代码未开源、无论文、无复现方法,99% 的 ARC-AGI-3 分数无法验证
提出的 '让 LLM 像物理学家一样推理' 的方向若真有实现手段,可能涉及将物理定律或符号约束引入 LLM 推理管线,但帖文中未给出任何架构细节,无法确认是否存在真正的技术创新
无
结合机会清单和风险矩阵判断后续关注重点