← Journal
  • 免费
NoteMAR 10, 20264 min

模型一遇到新信息就“变笨”了?一篇讲清搜索能力差异的实操笔记

收录于 AI 模型选型与评估 →

模型一遇到新信息就“变笨”了?一篇讲清搜索能力差异的实操笔记

【核心内容】

这篇核心不是聊模型参数,而是聊另一个更实际的问题:当你问的是 2025 年之后才出现的新东西,很多大模型为什么一下子答得又慢又飘,像突然掉线了一样。

原因不复杂。很多模型并没有真正“看过全文”,只是拿到搜索引擎返回的标题、链接和几十字摘要,再靠模型自己往下补。信息底子就这么薄,后面写得越长,幻觉概率越高。

把不同产品和搜索方案按“能不能拿到全文、能不能溯源、溯源精度够不够”做了分层,对做研究、写分析、查新资料的人有参考价值。

适合谁看

  • 经常拿 AI 查新信息、政策更新、模型动态的人
  • 做选题、写报告、写行业观察的人
  • 已经感觉到“同一个模型,有时聪明有时离谱”的人
  • 想判断该用网页版、API、Research 模式还是外部检索工具的人

如果你问的大多是常识、历史、基础知识,这篇帮助没那么大。

先说结论

别把“模型能力”跟“搜索能力”混为一谈。很多时候不是模型本身差,而是检索链路太弱。

一个简单判断标准:1. 只给摘要,不给全文,基本就别指望它稳定回答新话题 2. 能抓全文,但只能跳回开头,能用,但人工还得多核对 3. 能抓全文,还能定位到具体句子,实用性会高很多 4. 涉及 X、公众号这类强反爬站点,很多方案天然失效 5. 涉及 Reddit 回帖、YouTube 字幕这类特殊内容,不是所有搜索源都拿得到

所以,问 2025 年后的新东西,优先选“能取全文+能溯源”的工具;如果只是普通在线搜索接口,结果看着完整,实际很可能只是“100 字信息 + 900 字脑补”。

你需要准备什么

  • 一个你常用的大模型入口:ChatGPT、Claude、Gemini、Codex 都行
  • 至少一个能取全文的研究型工具
  • 人工核对习惯
  • 对“搜索结果不等于事实”的心理预期

的工具和分层大致如下:

  • 第一梯队:NotebookLM Web、Perplexity API
  • 第二梯队:Gemini Deep Research Web、GPT Deep Research Web、Claude Research Web、Manus Wide Research Web
  • 第三梯队:Tavily Extract API、Jina Reader API、Exa API、Grok Web
  • 第四梯队:Gemini Web
  • 第五梯队:GPT API / Web / Pro Web、Codex、Claude API / Web / Code、Gemini Deep Think Web、OpenRouter 的 :online
  • 第六梯队:Antigravity、Gemini API、Gemini CLI
  • 第七梯队:国内官方搜索链路

价格方面,只明确提到 Perplexity API 在 25 年 9 月开放,没有展开具体计费。这里建议自行验证。

按这个顺序做

  1. 先判断你问的是不是“训练后新信息” 如果是 2025 年后才发生的模型更新、产品变化、政策调整、站点规则变化,不要默认模型知道。2. 先看工具拿到的是摘要还是全文 如果只有十来条搜索结果,每条三四十字摘要,这种回答只能当线索,不能当结论。3. 优先选能全文抓取的方案 认为 NotebookLM Web、Perplexity API 这类方案更接近可用状态;Research 类网页产品次之;普通搜索增强型聊天产品再往后排。4. 看溯源能力够不够细 最好能跳到具体句子,其次是跳到文章开头。前者核验成本低很多。特别提到 Gemini Web 带 #:~:text= 这种句子级跳转,对人工复核有帮助。5. 遇到特殊站点别硬信

    • YouTube 字幕,认为 Google 侧能力更强
    • Reddit 回帖,认为 Google 更容易搜到
    • X、公众号这类有反爬的网站,很多方案直接失灵
  2. 最后自己做一次交叉验证 至少点开 2 到 3 个链接,确认模型引用的内容真在里,不要只看它写得像不像真的。

这里最容易踩坑

  • 把“会联网”当成“会查资料” 这两件事差很远。能联网不代表能读全文,更不代表能精准引用。

  • 看见带来源链接就放心 有些工具只给首页链接,不对应具体句子。模型中间怎么推出来的,你并不知道。

  • 以为 API 一定比网页强 我的判断恰好相反:不少 API 链路检索更弱,甚至只给临时重定向地址,不给真实来源。

  • 拿国内搜索链路查英文 AI 资料 如果题材本来英文信息密度就高,结果会明显打折。把这类情况单独列成一档。

  • 把模型“降智”误判成提示词问题 有时不是你不会提问,而是检索底子就不够,提示词只能微调,救不了信息缺失。

我的建议

真要拿 AI 做查新、做判断,先把工具分工定清楚:

  • 日常问答,用普通模型就够
  • 新信息检索,用能抓全文的 Research 工具
  • 高风险内容,用“模型总结 + 人工点开”双保险
  • 遇到 X、公众号、社区回帖这类内容,默认先怀疑抓取完整性

还有一个实用标准:如果答案里没有具体来源句子,或者你点不开验证,那这份回答最多算草稿,不算结论。

讲得最有价值的一点,就是把问题说透了:很多所谓“模型变笨”,本质上不是推理崩了,而是喂进去的信息本来就不够。先解决检索,再谈提智。