Daily AI Insight
数据源洞察报告

免责声明

本站内容由 AI 自动聚合、分析与生成,仅供信息参考与学习交流,不构成投资、法律、医疗或其他重大决策建议。请结合原始信源独立判断,作者不对因使用本站内容而产生的任何后果承担责任。

关于本项目

个人开源实验项目,由 @sqliang 构建与维护。

在 GitHub 查看源码

© 2026 Daily AI Insight Engine · Built with AI-assisted pipelines

← 返回 Hacker News
Analyzed·分析quesma.com2026-07-19

Article Intelligence

I burned all my tokens researching how to save tokens

打开原文 ↗

先看结论

Quesma公司研究员在研究AI token经济学时,因使用Claude的/deep-research工具在30分钟内耗尽订阅限额且无结果,转而构建了一个跨Claude、Codex和Antigravity三个订阅服务的多模型研究管道,通过角色分工、幻觉减少规则和管道顺序优化,将连续研究时间从30分钟延长至数小时且不增加费用。

核心指标

先判断这篇文章值不值得继续读

评分用于衡量信号强度,判断类指标用于解释方向、热度、后续动作与可信程度。

影响力

衡量事件对技术、产业或生态的外部影响强度。

4.5

这篇文章描述了一种实用但非颠覆性的工程实践——通过跨订阅编排多个AI模型(Claude/Codex/Antigravity)来扩展深度研究能力。其核心价值在于展示了角色化模型分配(根据Terminal-Bench/SWE-bench基准分配合适模型)、通过Bash包装器实现跨CLI子代理调用、以及减少幻觉的验证规则等具体技术方案。但该解决方案本质上是个人化的工程hack,依赖多个订阅服务的同时可用性,不具备通用产品化条件。对面临Token预算约束的研究团队有参考价值,但不足以改变行业竞争格局或引发范式转移。

复合价值

综合新颖性、可执行性与长期观察价值。

6.5

该方案的核心价值在于多订阅模型编排模式(role-based subagent orchestration + shared memory),本质是一种方法论而非可投资产品。长期复利效应体现在两点:一是该模式验证了'降本不降质'的可行性——用便宜模型做搜索/提取、昂贵模型做规划/裁决,这将推动更多企业采用混合模型策略;二是跨订阅箱的共享内存和自动回退机制,解决了一个真实痛点(单订阅限额瓶颈),但实现过于轻量(一个Bash脚本),容易被平台方原生能力替代(如Anthropic或OpenAI内置多模型路由)。该模式3-5年后大概率融合进成熟的Agent中间件,而非独立存在,因此评分中等偏上。

01

提取事实

结构化事实、实体识别与逻辑链

TL;DR

Quesma公司研究员在研究AI token经济学时,因使用Claude的/deep-research工具在30分钟内耗尽订阅限额且无结果,转而构建了一个跨Claude、Codex和Antigravity三个订阅服务的多模型研究管道,通过角色分工、幻觉减少规则和管道顺序优化,将连续研究时间从30分钟延长至数小时且不增加费用。

框架工具社区讨论已核实
客观摘要

Quesma的研究员为研究AI代理token经济学(tokenomics),最初使用Claude的/deep-research工具在30分钟内耗尽了Claude Max 5x计划的全部限额,且未生成有效结果。随后作者利用已有的Claude、Codex和Antigravity三个订阅服务,通过扩展claude-mem插件实现共享内存,并构建了一个Bash脚本包装器实现跨模型子代理调用。作者将不同模型分配给搜索、验证、规划、工具执行和独立审查等不同角色,并实施了发现者不验证、必须有URL和原文引用才能入库等规则以减少幻觉。最终将/deep-research移至管道最后一步,使连续研究时间从30分钟延长至数小时。

逻辑链
  1. 1作者为研究AI token经济学,使用Claude的/deep-research工具在30分钟内耗尽了Claude Max 5x计划的全部限额,且未生成任何有效结果。
  2. 2作者利用已有的Claude、Codex和Antigravity三个订阅服务,通过扩展claude-mem插件实现共享内存,将三者协同使用而不增加额外费用。

情绪

积极

整体偏利好,可优先看它带来的机会、受益方和后续扩散可能。

Hype

低 hype

噪声较低,信息更接近事实或研究贡献;重点看证据是否扎实。

文章没有任何PR包装迹象。作者诚实地从个人失败经历(Claude Max 5x计划30分钟耗尽限额且无结果)展开叙述,逐步展示迭代改进过程。提供了具体可复现的技术细节(Bash包装器代码、角色-模型映射表、幻觉减少规则),未使用'革命性''颠覆性'等夸张词汇。语言风格是工程分享而非商业宣传。

行动建议

深度研判

需要细读正文与风险机会区,适合做专题研判或内部讨论。

置信度

分别对应影响力、复合价值与 Hype 判断的可信程度。

影响判断high· 依据较充分
价值判断medium· 可参考
热度判断high· 依据较充分
  • 3作者将不同模型分配给不同角色:Claude Sonnet 5负责搜索,Claude Opus 4.8负责验证,Claude Fable 5负责规划和裁决,Claude Haiku 4.5负责提取和格式化,Codex(GPT-5.5)负责运行工具,Antigravity(Gemini 3.1 Pro)提供不同模型家族的独立视角。
  • 4作者实现了一个Bash脚本包装器让Claude代理可以调用Codex和Antigravity作为无头子代理,并监控输出中的使用限制消息以实现自动回退到Claude模型。
  • 5为减少幻觉,作者实施了严格规则:发现者不验证、必须有URL和原文引用才能入库、不陈述原文不包含的数字,这些规则随验证过程不断迭代。
  • 6作者将/deep-research移至管道最后一步,仅对已通过验证的发现进行深化和补缺,最后一次运行仅使用61个代理在22分钟内完成,对比首次的111个代理30分钟无结果。
  • 实体识别
    公司
    QuesmaAnthropicOpenAI
    技术
    tokenomicsdeep researchagentic codingTerminal-BenchSWE-bench
    人物
    Andrej Karpathy
    02

    影响与价值

    技术/商业影响、关注焦点与受影响对象

    开发者关注点

    跨订阅多模型编排模式和 Token 成本优化策略

    技术颠覆

    通过扩展 claude-mem 插件实现跨三套订阅服务(Claude/Codex/Antigravity)的共享内存,并用 Bash 包装器将不同厂商CLI工具编排为无头子代理,让不同模型家族(Anthropic/OpenAI/Google)协同工作而非简单替换,实现了角色化分工的实用多代理架构

    商业模式

    揭示了当前AI订阅服务定价模式下的隐性套利空间——同时持有多个独立订阅可在不增加总费用的前提下获得数倍有效Token配额和更长的连续工作时间,这可能推动API/订阅定价向跨平台整合或按量计费方向演进

    关键受益方

    • Anthropic
    • OpenAI
    • Google DeepMind
    • Quesma

    竞争受损方

    • 单一模型深度研究工具(如闭源 deep research 平台)
    • 高价按token计费的专有研究API
    • 缺乏多模型策略的AI咨询公司
    03

    风险、机会与行动

    结合机会清单和风险矩阵判断后续关注重点

    可关注的市场机会

    • 企业AI成本管理工具存在明确的商业化机会,可开发跨订阅(Claude、Codex、Antigravity)的统一token预算监控与配额调度平台,帮助团队在多个提供商之间自动分配任务以避免单点限额瓶颈
    • 多模型编排的"角色分工+共享内存"模式可被封装为开源框架或企业级中间件,让组织无需自建即可实现搜索、验证、规划、执行的角色分离与跨模型协同
    • AI可靠性治理工具存在落地空间——将本文"发现者不验证""必须有URL和原文引用"等反幻觉规则产品化为自动化验证流水线,可作为AI Agent工作流的标准组件
    风险信号
    监管
    无
    技术
    该方案依赖特定模型的API可用性和订阅计划稳定性,模型排名和基准(Terminal-Bench、SWE-bench Pro)每月变动,角色分配可能随模型迭代迅速过时;同时各平台可能调整无头子代理调用策略,使Bash包装器方案失效
    竞争
    Anthropic、OpenAI和Google可能通过改进自身deep research工具的原生体验与限额策略,使跨订阅编排方案的价值被削弱;此外Quesma等公司可能将类似能力产品化,挤压自建方案的空间
    伦理
    尽管作者设计了反幻觉规则,但多模型接力管道仍可能放大模型偏见或传播未验证信息,特别是当验证环节覆盖不全时,错误结论可能在共享内存中持久化

    阅读导览

    点击跳转到正文区块

    NAV
    01提取事实↘02影响与价值↘03风险、机会与行动↘

    文章属性

    框架工具社区讨论已核实

    关键实体

    公司
    QuesmaAnthropicOpenAI
    技术
    tokenomicsdeep researchagentic codingTerminal-BenchSWE-bench
    人物
    Andrej Karpathy

    影响对象

    受益方

    • Anthropic
    • OpenAI
    • Google DeepMind
    • Quesma

    受损方

    • 单一模型深度研究工具(如闭源 deep research 平台)
    • 高价按token计费的专有研究API
    • 缺乏多模型策略的AI咨询公司

    同源文章

    上一篇Bananas sprout in Rayleigh Garden UK after 15 years下一篇Minecraft: Java Edition now uses SDL3