买到的 API 是真模型吗?
中转站最常见的坑,是你按贵模型的价格付了钱,后端却悄悄给你换成了更便宜的模型或更旧的版本——业内叫「掉包」「降级」「掺水」。下面先讲清楚它们怎么做手脚,再给你一套不需要任何工具、充值前就能自己过一遍的自查清单。
没耐心看完?记住两条就够
- ① 价格低到不合常理、又说不清成本来源的,基本有问题——这是这一行最硬的信号。
- ② 真要确认,用你自己的 key 实测一次最直接。单次结果噪声大,多测几次看趋势。
中转站「掉包 / 降级」的 5 种形态
换便宜模型顶包
按 Claude、GPT-5 的价格收你的钱,后端实际跑的却是 GPT-4o-mini、Qwen、DeepSeek 这类便宜得多的模型。日常闲聊看不太出来,但一到复杂推理、长链路任务就容易露馅。
偷换版本
你点的是最新的 Sonnet 4.6 / Opus 5,实际给你的是更旧、更便宜的老版本。基准能力对不上,但模型名字看起来一模一样。
砍上下文 / 限输出
宣称支持长上下文,实际上悄悄把超长的输入截断;或者压低最大输出长度来省成本。长文场景下会明显「失忆」或者话说到一半被掐断。
响应字段伪装
把第三方模型的返回结果,包装成和官方一模一样的结构——伪造模型名、stop_reason、计费字段。光靠肉眼和粗略的脚本很难分辨。
间歇性掉包
只在高峰期或特定时段才切换到便宜后端,平时都正常。所以「测一次没问题」并不代表它一直没问题——这也是最难抓的一种。
零成本手动自查清单
不用任何工具,充值前先过一遍这 5 步。
先对价格,看它说不说得清成本来源
把它某个模型的单价和行业普遍底价比一比。注意:单纯便宜不等于有问题——走订阅切片、区域折扣、IDE 免费配额这类正规渠道的低价通常是真的。真正的危险信号是「价格远低于同行、又说不清楚这个价怎么来的」。这一步性价比最高。
用固定题做对比
准备几道你熟悉的、有一定难度的问题,在一个你信得过的渠道和这个待测渠道各跑一遍,对比回答的风格、详略、推理深度是不是同一个档次。
长上下文针测
塞一段足够长的文本进去,然后在结尾问一个只有看完前文才答得出来的细节。如果它「失忆」了或者内容被截断了,说明上下文可能被偷偷砍了。
版本能力针测
问一些该版本应该会、而旧版或便宜模型答不好的任务,看它的实际能力对不对得上它声称的版本号。
换时段多测几次
别只测一次。换个时间、换个网络多测几遍,专门用来抓那种「平时正常、高峰掉包」的间歇性问题。
手动自查的局限,和一组值得知道的数据
手动自查只能看出「像不像」,看不到计费层指纹、输出统计特征这些更难伪造的底层证据,比较主观、也容易被糊弄。掉包/降级不是个别倒霉——CISPA 亥姆霍兹信息安全中心 2026 年一篇实测论文(《Real Money, Fake Models》,arXiv:2603.01919)里,24 个受测中转端点中有近一半(45.83%)没能通过模型身份核验。所以这事值得在大额充值前认真对待。
一个诚实的提醒:任何单次检测都有噪声,「疑似不对」不等于铁证造假,多时段重复测、看整体趋势更靠谱。HowToken 的在线一键检测工具正在开发中。