测一测:你买的是不是真模型
怀疑中转站把你买的模型掉包成便宜货、或者偷偷降级了版本?填入接口地址和一个临时 Key, 我们当场发一次真实请求,核对模型名回显、计费元数据、响应结构这些不好伪造的硬指标。
Key 仅本次使用 · 不保存 · 不记录 · 建议用临时 Key 测完即删
这个问题有多普遍
45.83%
指纹测试中出现模型身份验证失败
47.21%
性能偏差最高
17 个
涉及中转服务
187 篇
曾被学术论文使用
以上为第三方独立研究数据,非本站统计。来源:CISPA 亥姆霍兹信息安全中心《Real Money, Fake Models: Deceptive Model Claims in Shadow APIs》(2026 年 3 月),arxiv.org/abs/2603.01919。详细方法论见鉴真方法。
这个工具检测什么
连通性
接口能不能正常调通,Key 是否有该模型的权限。
模型名回显
接口返回的 model 字段,和你请求的是不是同一个——名字对不上是掉包最直接的痕迹。
计费元数据
usage 里的 token 统计是否符合官方规范。缺失或结构异常,常见于第三方模型伪装。
响应结构
choices / message 等官方协议必备字段是否齐全。
模型自述身份
问模型自己是谁——请求 Claude 却自称 GPT、通义等,是掉包的直接证据。
精确计算(动态题)
每次随机出一道算式,答案唯一可验证。被换成能力较弱的便宜模型时容易算错。
上下文完整性
在长文开头埋一个随机校验码,末尾追问——答不出来说明上下文可能被偷偷截断。
Token 计数合理性
对比实际输入长度和它报的 prompt_tokens,量级明显不符可能是计费异常。
知识 cutoff 自述
问模型自己的训练数据截止时间。请求最新版却自称很老的 cutoff,可能被换成了旧模型。
指令遵循精度
给一个格式极严格的指令,看能否精确照做——这是模型能力的客观体现。
缓存命中行为
同一请求连发两次,观察是否命中缓存。有缓存通常意味着正规透传;没有也不代表有问题。
这几项能抓出明显的伪装,但抓不出「间歇性掉包」(只在高峰期换后端)和「能力悄悄下降」这类更隐蔽的情况。 想更全面地判断,配合手动自查清单一起用。
常见问题
我的 API Key 安全吗?
Key 只在这一次检测请求中使用,不会写入日志、不会存进数据库、检测完就随请求一起结束。即便如此,仍然建议你新建一个临时 Key 来测,测完在中转站后台删掉,这是最稳妥的做法。
检测会花我多少额度?
一次完整检测会发 5 条请求(身份、算术、上下文针测两次、格式遵循),输出都限制在 32 token 以内。其中上下文针测会发送约两千字的长文本用于验证是否被截断,因此输入 token 会多一些。按 Claude Opus 的价位估算,单次检测成本大约几分钱,可以放心测。
结果显示「存疑」是不是说明这家在造假?
不是。单次检测有噪声,网络抖动、站点临时异常都可能造成某项指标不达标。「存疑」只说明这一次调用里有指标不太对劲,建议换个时段重测几次看趋势,再下判断。
为什么显示「未见异常」,我还是感觉模型变笨了?
我们检测的 11 项里,精确计算、指令遵循这两项能部分反映能力水平,但仍然抓不出「间歇性掉包」(只在高峰期换后端)这类问题。遇到这种感觉,建议换不同时段多测几次,并配合手动自查里的固定题对比法一起判断。