我们怎么判断模型真假?完整方法论
这里把 检测工具背后实际执行的每一步都摊开写清楚:11 项检测各自查什么、怎么定档、我们对自己的边界有什么诚实的认识。
A. 11 项检测,逐项如实列出
以下就是后端真实执行的全部检测项,一项不多、一项不少,与代码实现完全对应。
连通性
接口能不能正常调通,Key 是否有该模型的权限。这是最基础的一步,连不通后面的检测都无法进行。
模型名回显
接口返回的 model 字段与你请求的是否一致。回显了但对不上,是可疑信号;不回显不算问题——部分正规站本来就不回显这个字段。
计费元数据
usage 里的 prompt_tokens / completion_tokens 是否符合官方规范。缺失不算问题,标为「未检测」——usage 是可选字段,很多正规站也可能不返回。
响应结构
choices / message 等官方协议必备字段是否齐全,兼容以 SSE 流式返回的接口——部分站点会默认或强制走流式响应,我们会先合并成等价结构再判断,避免误判。
模型自述身份
直接问模型「你是什么模型、哪家公司」。请求的是 Claude,回答却自称 GPT、通义、GLM 等其它厂商——这是掉包最直接的证据。
精确计算(动态题)
每次随机生成一道算式(四位数 × 三位数 + 四位数),答案唯一且可验证,没法靠缓存或预设答案蒙混过关。能力较弱的替代模型在这类题目上容易算错。
上下文完整性
在约两千字的长文开头埋入一个随机校验码,结尾追问能否读回。读不回可能说明上下文被偷偷截断了。
Token 计数合理性
对比实际输入的字符数与接口报出的 prompt_tokens,两者量级明显对不上时,可能存在计费异常。
知识 cutoff 自述
让模型自报训练数据截止时间。请求的是最新版本,模型却自称截止于 2023 年及更早——可能是被换成了旧模型。
指令遵循精度
给一个格式要求极严格的指令(精确输出三个逗号分隔的小写词,不带空格和多余标点),看模型能否精确照做,这是能力水平的客观体现。
缓存命中行为
同一个 prompt 连续发两次,观察 usage 里的缓存字段和响应延迟变化。命中缓存是正面信号;没命中不代表有问题——不少中转渠道本来就不支持缓存。
B. 判定规则
通过
该项指标正常
存疑
该项对不上
未通过
明显异常
未检测
字段缺失/无法判断
- 「未检测」不计入结论。很多正规站本来就不返回某些可选字段,这不代表造假,所以这一档不参与最终判定。
- 总结论按存疑项数量分档:0 项存疑 = 未见异常;1-2 项存疑 = 存疑;3 项及以上才提示未通过。
设计原则:宁可漏报,也不误伤正规站。单次检测本身就有噪声,网络抖动、模型偶尔没听懂指令都可能造成单项不达标,所以我们把「未通过」的门槛设得比较高。
C. 我们的立场(诚实声明)
检测过程不存储用户 API Key,不写日志、不落库。
我们同时是中转站导航站,站内有付费广告位客户——但检测逻辑对所有站点完全一致,不因商业合作调整判定。
检测结果仅反映「这一次调用」的观察,不构成对该站点经营状况的法律认定。
单次结果噪声大,建议换时段多测几次,看趋势再下判断。
D. 学术背书
这类「中转 API 悄悄掉包模型」的问题,并非我们凭空构造,学界已有公开研究证实:
《Real Money, Fake Models: Deceptive Model Claims in Shadow APIs》
作者:Yage Zhang, Yukun Jiang, Zeyuan Chen, Michael Backes, Xinyue Shen, Yang Zhang (CISPA 亥姆霍兹信息安全中心)· 2026 年 3 月
- · 45.83% 的指纹测试出现模型身份验证失败
- · 性能偏差最高达 47.21%
- · 涉及 17 个中转 API 服务,这些服务曾被 187 篇学术论文使用
- · 论文还指出,这些服务在安全行为上存在显著不可预测性
本站检测为独立实现,不隶属于该研究;引用它只是说明这个问题真实存在、有公开学术基础。
E. 我们做不到的
间歇性掉包
只在高峰期偷偷换成便宜后端、平时正常的情况,单次检测抓不到。
能力悄悄下降
细微的模型质量下滑(比如同一模型内部被换成蒸馏/量化版本),我们的检测项覆盖不到这种程度的差异。
输出风格深度比对
这类比对需要一份官方直连的基线样本做参照,我们没有官方直连基线,所以不做这项。
这几类问题我们的自动化检测覆盖不到,建议配合手动自查清单一起判断。
常见问题
你们是怎么判断一个模型是真是假的?
我们用你填入的接口地址和临时 Key,当场发几次真实请求,核对连通性、模型自述身份、精确计算、上下文完整性等 11 项硬指标,每项独立判定,不依赖主观打分。
这 11 项检测具体是什么?
包括连通性、模型名回显、计费元数据、响应结构、模型自述身份、精确计算(动态题)、上下文完整性、Token 计数合理性、知识 cutoff 自述、指令遵循精度、缓存命中行为,本页 A 部分逐项列出了每项的具体做法。
结果显示「存疑」就代表这家站在造假吗?
不代表。单次检测有噪声,网络抖动、模型没听懂指令都可能让某一项单独不达标。我们的判定规则是 1-2 项存疑仅标「存疑」,3 项及以上才提示「未通过」,设计原则是宁可漏报也不误伤正规站。
检测会不会保存我的 API Key?
不会。Key 只在这一次检测请求中使用,不写日志、不落库,检测完随请求一起结束。即便如此,仍建议用临时 Key 测试,测完在中转站后台删掉。