← Journal
  • 免费
ReviewAPR 16, 20264 min

Claude Opus 4.7 怎么看:该不该上、适合干嘛、哪里最费钱

收录于 AI 模型选型与评估 →

Claude Opus 4.7 怎么看:该不该上、适合干嘛、哪里最费钱

【核心内容】

这篇主要是把 Claude Opus 4.7 的公开信息和一线使用反馈拆开看,重点不是跑分有多高,而是它到底比 4.6 强在哪、贵在哪、适合放到什么场景里。

给了官方公告、模型文档、模型卡,也补了几个第三方榜单和用户反馈。能落地的部分主要集中在价格、上下文、输出速度、编程能力、视觉能力、计费变化,以及不同入口什么时候能用。

适合谁看

  • 已经在用 Claude 4.6,纠结要不要切 4.7 的人
  • 用 Claude Code、Cursor、Copilot 这类编程入口的人
  • 需要长上下文、图像理解、复杂任务连续执行的人
  • 对 Token 成本敏感,怕一换模型账单失控的人

如果你只是普通聊天、轻度问答,这里没给出足够证据证明 4.7 一定更划算。

先说结论

Claude Opus 4.7 不是“全面吊打 4.6”的版本,更像是“能力更强,但代价也更明显”的升级。

能确认的硬信息有这些:

  • 价格没变:输入 $5 / 输出 $25
  • 上下文没变:1M
  • 最大输出没变:128k
  • 输出速度大约 50 tps,比 4.6 快约 30%
  • 编程和视觉处理明显增强
  • Token 更费,尤其英文和代码场景
  • 长上下文注意力表现,用户反馈不算稳
  • 说话风格有些人觉得更像 GPT

如果你主要拿它做复杂编程、长链路任务、自主执行,4.7 值得试。如果你主要看长上下文稳定性和成本控制,不一定比 4.6 更舒服。

你需要准备什么

  • 一个能调用 Claude Opus 4.7 的入口:官网、API、Claude Code、Cursor、OpenRouter 等
  • 预算预期:虽然单价没涨,但总 Token 消耗可能会上去
  • 使用目标:先分清你是要“更强任务完成率”,还是要“更稳更省”
  • 备选路径:如果 4.7 不合适,回退方法是 /model claude-opus-4-6[1m]

还提到几个新功能:

  • /ultrareview:在线 review,额外收费;Pro 和 Max 可免费试用 3 次
  • auto 模式:可自主决策、连续执行,首次向 Max 用户开放
  • high 和 max 之间新增 xhigh

xhigh 的实际价值,我持保留态度,认为更像产品分层和营销动作。

按这个顺序做

  1. 先看你的核心任务是不是编程或复杂执行 如果是,这版最值得关注。4.7 的自主编程能力提升,能处理更难、更长链的任务,还会主动验证输出再汇报。对写代码、改代码、跑多步任务的人,这个变化比跑分更有用。2. 再看你是否依赖视觉输入 4.7 的图像处理上限提升到长边 2576 像素,是 4.6 的 3 倍。做截图分析、UI 检查、图片内容理解,这个提升是实际可感知的。3. 评估成本,不要只看官方单价 反馈是:4.7 因为分词器调整,更费 Token。中文约多 6%,英文约多 59%,Python 约多 21%。如果你大量写代码、读英文文档,单次任务成本会比 4.6 更高。4. 长上下文任务先做小样本测试 虽然上下文依然是 1M,但引用的 MRCR 测试和社区反馈认为,4.7 在超长上下文下的注意力表现有下降。也就是说,“能塞进去”不等于“还能稳稳抓重点”。5. 选入口时顺手看倍率和活动
  • 官网 / App 已上线
  • OpenRouter Chat 和 API 已上线
  • Claude Code 已上线
  • Cursor 已上线,限时半价
  • Augment 已上线,260430 前半价
  • Windsurf 已上线,试用号也能用
  • droid 已上线,倍率 1x
  • Copilot 已上线,4.7 为 7.5x 倍率,260430 后可能 15x;按条数收费,最高 only medium,上下文 200k,且需 Pro+ 会员,$10 Pro 没有 4.7

这里最容易踩坑

  • 以为价格没变,就等于成本没变 不是。真正花钱的是“单价 × Token 总量”。4.7 的问题不在标价,在更吃 Token。

  • 以为 1M 上下文就适合无脑塞资料 反馈恰恰相反。超长上下文场景,建议自己测召回、定位、引用准确率。这里没展开,建议自行验证。

  • 看到榜单高就默认所有任务都更强 LMArena、ArtificialAnalysis、ARC-AGI、HLE 这些榜单能参考,但不能替代你的真实任务。也提到 NYT Connections 这类项目上,4.7 分数甚至不到 4.6 的一半。

  • 误把新模式当刚需 /ultrareview、auto、xhigh 都是新增点,但不是每个人都需要。先确认你的工作流能不能吃到收益,再决定是否迁移。

我的建议

如果你是重度代码用户,尤其在 Claude Code、Cursor 里做复杂改写、长链路修复、自动验证,4.7 可以优先试。它的强项更像“干活能力”,不是“聊天更惊艳”。

如果你更在意长上下文稳定性、账单可控、风格自然,先别急着全量切。最稳的做法是双模型并行:复杂编程给 4.7,长资料检索和普通对话先留在 4.6。

最后只看一条判断:你要的是更强执行,还是更低代价。4.7 更像前者,不是免费午餐。