Daily AI Insight
数据源洞察报告

免责声明

本站内容由 AI 自动聚合、分析与生成,仅供信息参考与学习交流,不构成投资、法律、医疗或其他重大决策建议。请结合原始信源独立判断,作者不对因使用本站内容而产生的任何后果承担责任。

关于本项目

个人开源实验项目,由 @sqliang 构建与维护。

在 GitHub 查看源码

© 2026 Daily AI Insight Engine · Built with AI-assisted pipelines

← 返回 TLDR AI
Analyzed·分析x.com

Article Intelligence

Schema (2 minute read)

打开原文 ↗

先看结论

新框架 [schema] 在 ARC-AGI-3 公开测试集上使用 Opus 4.8 + Fable 5 达到 99% RHAE,使用 GPT-5.6 Sol 达到 95.35% RHAE,核心理念是让 LLM 像物理学家一样思考。

核心指标

先判断这篇文章值不值得继续读

评分用于衡量信号强度,判断类指标用于解释方向、热度、后续动作与可信程度。

影响力

衡量事件对技术、产业或生态的外部影响强度。

2.5

该事件为一则社交媒体短帖(X/Twitter),声称新框架 [schema] 在 ARC-AGI-3 上达到 99% RHAE。评分依据如下:(1) 消息源仅为个人 X 账号,无论文、无代码、无技术细节,完全不可复现验证;(2) 模型名 'Opus 4.8'、'Fable 5'、'GPT-5.6 Sol' 非常规命名,'RHAE' 也非 ARC 基准的已知标准指标,引入自创指标而无定义是典型 PR 手法;(3) 认识论状态已被标注为 pr_statement,属于宣传性陈述;(4) 若属实本应为范式级影响(10分),但以当前呈现形式,对行业实质冲击力接近于零。

复合价值

综合新颖性、可执行性与长期观察价值。

7.5

从 VC 视角看,[schema] 在 ARC-AGI-3 上达到 99% 的分数本身就是强信号——ARC-AGI 系列以泛化推理难度著称,此前很少有框架能接近这个水平。核心价值在于它定义了一个模型无关的推理层('像物理学家一样思考'),这是一种元认知范式,不同于 Chain-of-Thought 或 Tree-of-Thought 等结构化提示技巧。如果这一范式可跨模型、跨任务泛化,它将成为一个独立的推理基础设施层,具备长期复利效应(模型迭代,但推理框架积累方法和数据飞轮)。但风险同样显著:目前仅有一个 X 帖子作为证据,无代码、无论文、无可复现结果,99% 的高分在成熟基准上需要独立验证。此外,'think like a physicist' 是否能在更广泛任务上推广仍存疑。综合来看,有成为新推理范式基石的潜力,但目前尚处于'需严格验证'阶段,给 7.5 分。

01

提取事实

结构化事实、实体识别与逻辑链

TL;DR

新框架 [schema] 在 ARC-AGI-3 公开测试集上使用 Opus 4.8 + Fable 5 达到 99% RHAE,使用 GPT-5.6 Sol 达到 95.35% RHAE,核心理念是让 LLM 像物理学家一样思考。

框架工具科技媒体公关声明
客观摘要

作者 havenfeng 在 X 平台上发布了一个名为 [schema] 的新框架(harness),该框架旨在让大语言模型像物理学家一样推理。根据公告数据,[schema] 在 ARC-AGI-3 Public 测试集上,搭配 Opus 4.8 和 Fable 5 模型实现了 99% 的 RHAE 分数,搭配 GPT-5.6 Sol 模型实现了 95.35% 的 RHAE 分数。

逻辑链
  1. 1作者 havenfeng 宣布了一个名为 [schema] 的新框架(harness)。
  2. 2[schema] 的核心设计理念是让大语言模型像物理学家一样进行推理和思考。
  3. 3

情绪

中性

更像事实更新或研究记录,情绪不强;按影响力和复合价值决定阅读深度。

Hype

高 hype

宣传或概念成分较高,先验证证据,再决定是否投入时间。

严重的概念炒作预警。'99% RHAE' 是一个极高的分数,瞄准 ARC-AGI 这一具有标杆意义的基准,但全文仅两句话,无任何方法论、架构图、消融实验或代码链接。使用非标准指标 'RHAE' 而非 ARC 常规的 accuracy/pass@k,模糊了对比基准。'像物理学家一样思考' 是典型 PR 修辞,无具体技术落脚点。整体呈现出 benchmark-washing 的特征。

行动建议

前瞻关注

前瞻性强但不确定,适合放入观察清单,不急于行动。

置信度

分别对应影响力、复合价值与 Hype 判断的可信程度。

影响判断low· 需谨慎
价值判断low· 需谨慎
热度判断high· 依据较充分
在 ARC-AGI-3 Public 测试集上,[schema] 搭配 Opus 4.8 和 Fable 5 模型达到了 99% 的 RHAE 分数。
  • 4同样在 ARC-AGI-3 Public 测试集上,[schema] 搭配 GPT-5.6 Sol 模型达到了 95.35% 的 RHAE 分数。
  • 实体识别
    技术
    RHAEARC-AGI-3schema
    人物
    havenfeng
    02

    影响与价值

    技术/商业影响、关注焦点与受影响对象

    开发者关注点

    代码未开源、无论文、无复现方法,99% 的 ARC-AGI-3 分数无法验证

    技术颠覆

    提出的 '让 LLM 像物理学家一样推理' 的方向若真有实现手段,可能涉及将物理定律或符号约束引入 LLM 推理管线,但帖文中未给出任何架构细节,无法确认是否存在真正的技术创新

    商业模式

    无

    关键受益方

    • [schema] 创始团队
    • Anthropic
    • OpenAI
    • ARC Prize Foundation

    竞争受损方

    • 现有提示工程框架(CoT/ToT 变体)
    • 纯规则驱动的 RPA 厂商
    • 过度依赖'更大模型+更多数据'路径的 AGI 初创公司
    03

    风险、机会与行动

    结合机会清单和风险矩阵判断后续关注重点

    可关注的市场机会

    • 借鉴「像物理学家一样推理」的范式,可开发面向科学发现场景(如物理模拟、药物分子设计、材料基因组)的专用推理增强工具,将 LLM 的符号推理与物理直觉结合
    • 若 [schema] 框架的技术方案被验证有效(发布论文或开源),创业者可围绕 ARC-AGI 系列基准构建模型评测服务或推理优化中间件,服务需要高泛化能力的行业客户
    • ARC-AGI-3 接近饱和的测试成绩可能催生新一代 AGI 评测基准的创业机会——为区分超高分模型而设计更难、更具代表性的评测集
    风险信号
    监管
    无直接监管风险,但 AGI 基准的突破性进展可能引发 AI 安全治理层面的关注,若该框架宣称的能力被后续验证,或触发出口管制与模型安全审查讨论
    技术
    单一 X 平台推文公告,无论文、无代码、无复现实验,99% RHAE 的极端高分为典型的「非凡主张需非凡证据」场景,存在技术造假、实验不可复现或评测集污染(data contamination)的显著风险
    竞争
    若该框架真实有效,将大幅拉高 ARC-AGI 赛道的竞争门槛,迫使其他团队跟进类似推理范式;若为虚假宣传,则属噪声,但可能短暂误导投资关注流向
    伦理
    「接近完美通过 AGI 基准」的表述易引发公众对 AGI 已到来的过度解读和恐慌,存在通过夸大基准成绩进行营销炒作以获取融资或关注的伦理风险

    阅读导览

    点击跳转到正文区块

    NAV
    01提取事实↘02影响与价值↘03风险、机会与行动↘

    文章属性

    框架工具科技媒体公关声明

    关键实体

    技术
    RHAEARC-AGI-3schema
    人物
    havenfeng

    影响对象

    受益方

    • [schema] 创始团队
    • Anthropic
    • OpenAI
    • ARC Prize Foundation

    受损方

    • 现有提示工程框架(CoT/ToT 变体)
    • 纯规则驱动的 RPA 厂商
    • 过度依赖'更大模型+更多数据'路径的 AGI 初创公司

    同源文章

    上一篇Introducing LM Studio Bionic: the AI agent for open models (4 minute read)下一篇NVIDIA Nemotron 3 Embed (9 minute read)