先讲一个上个月我们社区里的真实翻车案例。一位开发者给自己的AI助手接了Claude API,做汇率换算和行业资讯摘要功能,上线第三天就收到用户投诉——「你这算出来的是一个月前的旧汇率」。模型没算错数,是它压根不知道今天的汇率是多少。
这不是个别现象。大模型的训练数据有截止日期,参数在训练完成那一刻就冻结了,之后发生的事它一概不知。更麻烦的是,多数模型不会老实承认「我不知道」,而是基于旧知识编一个格式工整的答案——旧价格、旧版本号、已经下线的产品,看起来煞有介事。用户不核对,错误信息就这么散出去了。
解法其实很成熟:给模型外接一个联网搜索API,先查再说。但真到选型的时候,坑来了——Perplexity Sonar、Tavily、Gemini Search Grounding、OpenAI Web Search,名字都听过,计费方式却完全不同:有的按token算,有的按搜索次数算,有的两个一起算,还有的免费额度大到用不完。这篇文章就用各家官方页面的价格(2026年9月采集),把这笔账算清楚。结论先放前面:小项目有大量免费额度可以白嫖;规模化之后,不同方案的月账单能差出三倍以上。
一、为什么大模型必须外接搜索API
先说清楚两个绕不开的硬限制,理解了它们,后面的选型逻辑就都顺了。
第一个是知识截止(knowledge cutoff)。每家模型发布时都会标注训练数据的截止时间。你问它截止日期之后的新闻、价格、政策,等于问一个断网的人今天的头条——他真不知道。比如你让模型推荐一款「最新」的编程模型,它给你报的很可能还是半年前的版本。
第二个是幻觉(hallucination)。这是知识截止的恶性变种:模型不会说「我不知道」,它会用旧参数生成一个「看起来正确」的答案。做汇率、做报价、做资讯类应用,这是最危险的一类错误,因为它有迷惑性。
那RAG呢?很多同学会问:我搭了RAG知识库不就解决了吗?RAG和联网搜索解决的是两块数据:私有知识(公司文档、内部规章、产品手册)适合进RAG向量库,这部分我们写过完整的《从零搭建企业级RAG知识库》;而公开的实时信息(新闻、汇率、竞品价格、最新版本)用RAG管不住——你不可能每小时把全网重新灌一遍向量库。成熟的产品通常是两套都上:私有问题查向量库,实时问题走搜索API。
从工程实现讲,接入搜索就是一次Function Calling:把搜索注册成工具,模型判断需要实时信息时自己发起调用,拿到结果再组织答案。流程细节可以看我们的《Function Calling从入门到生产级应用》,本文重点讲选型和成本。
二、四大主流方案横评:价格与计费规则
直接上数据。以下均为2026年9月从各官方渠道采集的公开标价(美元价格按1:7.2估算人民币):
| 方案 | 计费结构 | 免费额度 | 特点 |
|---|---|---|---|
| Perplexity Sonar | token费 $1/$1 每百万 + 请求费约$5/千次 | 无(部分时段送试用金) | 搜索+生成一体,自带引用 |
| Tavily | 按credit:基础搜索1个/次,进阶2个/次 | 每月1000 credits | 纯搜索工具,配任意LLM |
| Gemini Search Grounding | 按搜索查询计费:Gemini 3约$14/千次 | Gemini 3每月5000条提示 Gemini 2.5每天1500次请求 |
官方白嫖额度最大 |
| OpenAI Web Search | token费另加搜索调用费(约$10~25/千次级别) | 无 | 生态一体,省心但贵 |
| 博查 Web Search | 约0.036元/次调用 | — | 国内直连,无网络门槛 |
数据来源:Tavily官方定价文档 · Google AI官方定价页 · Perplexity官方API文档 · 厂商价格随时可能调整,下单前请以官方页面为准
逐个说清楚,重点是计费规则里的细节——这些细节才是账单差异的真正来源。
Perplexity Sonar:搜索加生成,一步到位
Sonar的定位是「答案引擎API」:你发一个问题过去,返回的是带引用来源的最终答案,不是一堆链接列表。基础版sonar的token价格是输入/输出各$1每百万tokens,另加约$5/千次请求的搜索费(长上下文请求会高一些,官方文档标到$12/千次);能力更强的sonar-pro是$3/$15,引用密度更高。
它的接口完全兼容OpenAI SDK格式,迁移成本低。但要注意一个本质问题:答案由Perplexity的模型生成,你不能换成自己的模型。如果你想让搜索结果过一遍DeepSeek或者你微调过的模型,Sonar做不到。
Tavily:给Agent配的纯搜索工具
Tavily走的是另一条路线:只做搜索,不碰生成。你发查询,它返回网页结果、摘要、链接和相关度评分,生成交给你自己选的任意模型。这种「工具化」的解耦在Agent架构里特别受欢迎——LangChain、LlamaIndex等主流框架都有现成的集成。
价格方面,Tavily每月送1000个免费credits,注册不需要信用卡。基础搜索1次消耗1个credit,进阶搜索消耗2个;超出免费额度后按量付费$0.008/credit,包月套餐折算下来$0.005~0.0075/credit。原型验证阶段基本白嫖,但量上来之后是纯线性支出。
Gemini Search Grounding:白嫖额度最凶的官方方案
Google把自己的搜索能力开放给了Gemini API,叫Search Grounding。这是所有方案里免费额度最夸张的:按官方定价页,Gemini 2.5系列(Flash/Flash-Lite)的grounding免费层是每天1500次请求;新一代Gemini 3是每月5000条提示免费,超出后按每千次搜索查询$14计费。
计费规则有个对开发者很友好的细节:检索到的网页内容不注入输入token计费(实测promptTokenCount几乎不变),主要成本是模型自己的思考和输出token,而Flash系的token价格本来就便宜。这对高频调用场景是实打实的优惠。
Gemini按「实际执行的搜索查询数」计费,而不是按「你的请求次数」。有开发者实测:同一个问题,不同模型会触发1到7次不等的内部搜索(返回结果里的webSearchQueries字段能数出来)。你以为调了一次,账单上可能是三四次。做成本预估时,请按请求次数乘一个1.5~3的系数留余量。
OpenAI Web Search:省心,但账单不省
OpenAI的路线和Gemini类似:gpt-4o-search-preview系列模型内置联网搜索(token价格$2.50/$10每百万,mini版本$0.15/$0.60),搜索工具调用费另计(第三方价格跟踪显示在$10~25/千次区间,不同模型和上下文档位不同,以官方定价页为准)。优点是如果你整个技术栈都在OpenAI生态里,接入是最无缝的;缺点是综合成本在几家里基本垫底,后面算账能看到。
国内阵营:博查和阿里云百炼
海外API对国内开发者始终有网络和支付两道坎。国产替代里,博查(Bocha)的Web Search API按次计费约0.036元/次,返回结果包含网页标题、链接、摘要、发布时间,明确面向AI场景优化;阿里云百炼的Web Search MCP服务给所有用户2000次免费调用,之后约29元/千次(新加坡区$10/千次),它家模型内置的联网搜索高速版更是低到8元/千次。直接支付宝付款、国内网络直连,这是海外方案给不了的体验。
三、算一笔明白账:月3万次搜索要花多少钱
设定一个有代表性的场景:日活1万左右的AI助手类应用,每天产生约1000次搜索,月3万次。假设每次搜索平均消耗输入2000 tokens、输出800 tokens(典型的查询+摘要摘要长度),生成模型用DeepSeek V3.2(输入2元/百万、输出3元/百万)。逐个方案算:
Gemini 2.5 Flash Grounding方案:每天1000次 < 免费的每天1500次 → 搜索费0元。只付模型token费:输入4500万×$0.3/百万 + 输出1500万×$2.5/百万 ≈ $51,约370元。
Perplexity Sonar方案:请求费30×$5=$150;token费约$84。合计约$234,约1700元。
Tavily方案:3万credits减去免费1000,剩2.9万×$0.008=$232;加上DeepSeek生成费约216元。合计约$262,约1900元。
博查+DeepSeek方案:搜索费3万×0.036元=1080元;加DeepSeek生成费216元。合计约1300元。
OpenAI mini-search-preview方案:token费约$23;搜索调用费按$25/千次算是$750。合计约$773,约5600元。
同一件事,370元对5600元,差出15倍。当然各方案的能力不完全等价(引用质量、中文搜索效果、结果结构化程度都有差异),但数量级的差距摆在这里。而这一切的配置成本,不过是改一个base URL的工作量。
需要说明:以上是基于假设用量的测算,你的实际费用取决于查询长度、触发搜索的次数(还记得Gemini的webSearchQueries坑吗)和具体档位价格。但结论方向是稳的:有免费额度先用免费额度,规模化之后按每千次搜索的真实单价重新算账。
四、怎么选:按场景对号入座
测评看完了,落到自己身上怎么选?我们社区里比较成熟的几条经验:
- 原型验证、个人项目 → Tavily免费额度(每月1000 credits)+ DeepSeek。零成本跑通全流程,接口还是框架原生支持的。
- 预算敏感的正式产品 → Gemini 2.5 Grounding白嫖每天1500次,超了再切付费;中文场景重点测一下搜索质量再上量。
- 要引用质量、要省事 → Perplexity Sonar。搜索加生成一步到位,答案自带来源,做资讯类产品体验最好。
- 已重仓OpenAI生态 → 继续用web search tool,生态一致性值这个溢价,但建议做一层成本监控。
- 国内合规、国内网络 → 博查或阿里云百炼,支付和网络都没有任何门槛,百炼还有2000次免费。
- 重度使用、成本敏感 → 搜索和生成拆开(Tavily/博查负责搜,DeepSeek负责写),别为一体化方案的品牌溢价买单。
另外一个建议:别锁死在一家。搜索API的接口都很薄,套一层统一的抽象(或者直接上MCP),主用一家、备用一家,哪家调价或者抽风就切走——搜索服务的稳定性从来不是百分百,这个和多模型故障转移是同一个思路。
五、三条省钱实战经验
很多请求其实不需要联网(闲聊、常识问题、私有知识),无脑全量搜索是最大的浪费。在调用前加一层意图判断——用便宜的小模型先分类「这个问题需要实时信息吗」,或者干脆写规则。我们实测能砍掉40%以上的无效搜索调用,这一层的收益比换便宜API大得多。
「今天金价多少」这种问题,一分钟内可能被问几十次,但答案不需要实时到秒。对热门查询做短TTL缓存(比如5~15分钟),命中就不调API。这和模型侧的Prompt Caching命中计费是同一个思想:重复的东西,绝不付两次钱。
前面说过,Gemini按内部搜索查询数计费,一个请求可能拆成多次搜索。上线前用真实流量压一遍,统计平均每次请求触发的搜索数,把它写进成本模型。另外别忘了监控429限流——搜索API的限流普遍比聊天API严格,突发流量下的重试策略我们在这篇《429限流应对指南》里详细写过。
核心结论速记
- 大模型的知识截止和幻觉决定了实时信息必须外接搜索API,RAG管私有知识,搜索API管公开实时信息。
- 免费额度排序:Gemini 2.5每天1500次请求 > Gemini 3每月5000条提示 > 阿里云百炼2000次 > Tavily每月1000 credits。
- 月3万次搜索实测算账:Gemini免费层约370元 vs OpenAI方案约5600元,差15倍;规模化后博查+DeepSeek约1300元最省。
- 选型看架构:要一体化选Sonar,要可控性选Tavily/博查+自选模型;国内场景优先百炼和博查。
- 省钱三板斧:意图判断过滤无效搜索、热查询短TTL缓存、按真实搜索次数(而非请求数)做成本预估。
六、常见问题(FAQ)
大模型联网搜索API哪家免费额度最大?
Google Gemini最慷慨:Gemini 2.5系列的Search Grounding免费层为每天1500次请求(Flash和Flash-Lite共享),Gemini 3为每月5000条提示免费;Tavily每月送1000个API credits(基础搜索1次1个credit,无需信用卡);阿里云百炼的Web Search MCP送2000次。小项目靠这些免费额度基本能跑起来,规模化之后再考虑付费方案。
Perplexity Sonar和Tavily有什么本质区别?
Sonar是搜索+生成一体化:你发一个问题,它返回带引用的最终答案,但答案由Perplexity的模型生成,你不能换成自己的模型。Tavily是纯搜索工具:只返回网页结果、摘要和链接,答案生成交给任意你选择的LLM(比如便宜的DeepSeek)。要可控性和灵活选Tavily,要省事和引用质量选Sonar。
国内开发者怎么稳定使用这些搜索API?
两条路:一是直接用国内方案,博查Web Search API(约0.036元/次)或阿里云百炼的联网搜索/Web Search MCP(免费2000次后约0.029元/次),网络和支付都没有门槛;二是通过API中转平台调用海外服务,选型时重点看稳定性和价格透明度,具体可以看我们的《国内API中转平台选择指南》。
搜索API返回的内容可以直接展示给用户吗?
建议只展示摘要并附上原文链接和出处,而不是大段复制网页正文。一方面各家API的条款对内容展示有不同程度限制,另一方面搜索引擎和版权方对采集正文的容忍度有限。带引用的摘要是行业通行做法,也是对原内容方的尊重。
写在最后
联网搜索API这个品类,正在从「高级功能」变成AI应用的「水电煤」。但各家计费规则五花八门——按token的、按次数的、按内部搜索查询数的——不把规则吃透就上量,月底账单一定会给你惊喜(惊吓的那种)。
我们的建议始终是那条朴素的原则:先用免费额度验证需求,再按真实用量算账迁移。Gemini的白嫖额度适合起步,博查和Tavily适合规模化,Sonar适合要引用质量的资讯场景,OpenAI适合不差钱的生态党。想横向比较更多AI API服务商的价格和能力,TokenNexus收录了330+国内外平台,从海外官方、聚合中转到国内平台都整理好了。如果你最近在搭Agent,还可以看看我们刚发的《Cline接入DeepSeek成本实测》,把模型侧的成本也一起压下来。
文中所有价格均来自各厂商官方定价页面及官方文档(采集于2026年9月7日),成本测算基于文中标注的假设用量,实际费用请以各平台账单为准;Perplexity与OpenAI的部分档位价格存在多个第三方跟踪来源的差异,已按保守口径标注区间。最后更新:2026年9月7日。