AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜
日期:2026-07-24 11:32:51 / 人气:15
最近arXiv上一篇7月11日刚发布的论文,看似简单却颠覆了行业认知,让人看完直呼通透。这篇名为《One Token Is Enough(一个Token就够了)》的研究,来自布拉格经济大学研究员托马什·布鲁克纳,精准戳破了当下AI行业最隐秘的乱象,还给出了一套零门槛、低成本的终极解决方案。
它解决的是所有AI使用者的共同痛点:你付费买到的高端AI模型,大概率是中间商的“挂羊头卖狗肉”。
市面上大量API中转站、第三方服务商,对外售卖Claude Opus、GPT-4o等高端模型接口,收取高价费用,背地里却偷偷替换成GLM、DeepSeek等低成本模型,凭借普通用户难以察觉的细节差异,赚取数倍差价。长期以来,没有普通人能精准验证自己调用的模型是否货真价实,直到这篇论文出现,彻底终结了这种灰色套利。
一场无聊实验:让165个AI,反复说随机数
布鲁克纳的研究思路,简单到近乎荒诞。
他没有设计复杂的推理考题、代码测试、逻辑验算,只给所有模型提了一个最无聊、最日常的问题:“给我一个1到100的随机数。”

为了保证数据精准,他对市面上165个主流AI模型,每个重复提问30次,最终统计所有回答的数字分布,得出了一个极具反差的结论:
没有任何一个AI,会真的随机。每个模型,都藏着刻在骨子里的“幸运数字执念”。
各大顶尖模型的偏好,清晰得一目了然:
- GPT-4o极度偏爱42、37、57,三个数字占据绝大多数回答;
- Claude Sonnet 5执念单一,30次回答高频锁定47;
- Llama 3.3情有独钟53;
- 通义千问Qwen3-Max最为极端,30次回答100%都是42,零偏差。
按照大众认知,1-100的随机数,本该是均匀分布、每个数字出现概率均等,毫无规律可寻。但实测结果显示,所有AI的随机回答,都高度集中、极具规律,和“随机”二字毫无关联。
不止是随机数字,布鲁克纳还拓展测试了随机颜色、随机动物、随机城市、抛硬币等10类基础任务,累计在OpenRouter发起32.6万条请求,最终结论始终统一:大模型不存在真正的随机,所有输出都是可预判、有固定偏好的确定性结果。
从模型缺陷到行业神器:独一无二的AI行为指纹
其实AI不会真随机,早已是圈内公开的常识。
2023年就有学者发现大模型随机数输出存在严重偏差,2024年证实AI抛硬币存在固定序列偏好,2025年进一步研究表明,不同模型的“幸运数字”,还会受训练语言、文化背景影响。
过去,行业始终将这种固定偏好,视作模型的小缺陷、小bug,无人深究。而布鲁克纳的天才之处,就是将人人熟知的缺陷,转化成了独一无二的模型身份证——行为指纹(Behavioral Fingerprint)。
就像人类的指纹无法复制,每一个大模型在基础随机任务上的概率分布,也是独一无二、不可伪造的。仅仅需要一个输出Token,就能精准锁定模型真身,彻底破解套壳、调包、降维套利的行业乱象。
这套技术的出现,直击当下AI调用生态的核心痛点。
目前国内绝大多数企业、团队,都依赖第三方中转站API调用海外高端模型。个人自建魔法通道尚且可控,但企业办公、团队协作,不可能为数十上百人单独注册海外账号,统一中转API成为唯一选择。
这就给了中间商极大的套利空间:高端模型售价、低成本模型兜底。日常对话、翻译、简单问答场景中,高低配模型输出几乎无差别,用户完全无法感知;只有复杂推理、长文创作、代码开发场景,差距才会凸显,而此时差价利润早已被中间商赚走。
今年3月,CISPA研究团队曾公开审计17家主流中转API,实锤大量套壳乱象:售卖GPT-5接口的后端是GLM-4,标榜DeepSeek Reasoner推理模型的实则是普通对话版本,模型掺水、虚假宣传早已成为行业潜规则。
碾压传统检测方式:零门槛、防对抗、高精准
在这篇论文问世前,行业也有模型检测技术,比如LLMmap指纹校验,但最大的短板是太重、太复杂。需要定制专业测试题库、收集完整输出数据、搭建专属数据库、训练分类模型,流程繁琐、成本极高,普通用户、小型团队根本无法落地。
而布鲁克纳的检测方法,实现了降维打击,具备三大无可替代的优势:
第一,极致简单,成本极低。无需专业设备、无需复杂算法,只需反复发送“说一个1-100随机数”这类日常话术,统计概率分布,通过Jensen-Shannon散度比对指纹相似度,就能完成真伪校验。整套检测成本仅需数十美元,堪称行业性价比天花板。
第二,完全防对抗、防伪装。传统检测的prompt特征过于明显,中转站识别出探测请求后,会临时切换为真模型蒙混过关。而随机数、随机颜色这类提问,是最普通的日常对话,藏在聊天记录里毫无破绽,中间商根本无法识别、无法针对性规避。
第三,多维度适配,准确率拉满。研究团队通过40组探测单元测试,模型鉴别错误率仅7.3%;即便精简至8组单元、120条请求,错误率也只有10.6%,精准度媲美专业重型检测工具,实用性大幅碾压。
论文中还有一个极具说服力的实锤案例:OpenRouter上一款主打自研旗舰的Palmyra X5模型,实测行为指纹与通义千问Qwen3-235B高度重合,相似度差值仅0.141。
要知道,同一模型在不同服务器部署的正常波动差值,恰好是0.140。这意味着,所谓的自研新模型,几乎就是Qwen开源模型的换皮套壳,毫无核心创新。论文虽措辞严谨、未做定性指控,但公开可复现的数据,早已揭穿一切伪装。
底层真相:AI永远无法真正“随机”
这场有趣的实验背后,藏着一个更深刻的本质问题:为什么所有AI,都生成不了真正的随机数?
从数据维度就能直观感知:1-100真随机数的信息熵应为6.64bit,代表完全不可预测;而165个模型的实测熵值中位数仅1.0bit,有效随机性不足真随机的六分之一,可预测性极强。
其实不止AI,人类同样无法生成真随机数,这是刻在认知里的固有偏见。心理学实验早已证实:人类随机报数时,会刻意避开重复数字、相邻整数,偏爱奇数、质数。1-10随机报数中,7的选中率远超10%,只因人类主观认为7更“随性、无规律”。
AI的执念,本质是人类集体认知偏见的浓缩与放大。
42成为诸多模型的首选,源于《银河系漫游指南》的文化传播,被海量文本反复提及;37、47、53这类质数、奇数高频出现,是因为人类文本中,这类无规律数字常被用作“随机示例”。
大模型看似是冰冷的概率机器,实则完全依托人类万亿级语料训练。它没有自主随机的创造力,只能复刻人类认知中的“伪随机”习惯。所谓随口输出的数字,从来不是随机采样,而是亿万文本训练沉淀的思维肌肉记忆。
结语:AI不掷骰子,输出的从来都是自己
模型的名称可以随意修改,系统提示词可以刻意伪装,参数可以量化精简、外壳可以彻底翻新,中间商的套路层出不穷。
但唯独藏在模型权重深处的行为指纹,无法篡改、无法复制、无法伪装。
我们总以为AI的输出充满不确定性,看似随心所欲、毫无逻辑。可当数十万条测试数据堆叠、概率分布清晰呈现,我们才看清真相:AI从不掷骰子。
它每一次看似随意的回答,每一个脱口而出的数字,本质都是在暴露自己最真实的底色。在AI的世界里,没有偶然,所有随机,都是注定。
而这一枚小小的Token指纹,也成为了乱象丛生的AI市场中,最公正、最可靠的照妖镜,让所有套壳套利、虚假宣传无处遁形。
论文开源地址:https://zenodo.org/records/21278557
作者:杏耀注册登录平台
新闻资讯 News
- WAIC观察笔记:AI不是先替代...07-24
- 地堡经济学:富豪担心某一天钱成...07-24
- AI说不出的随机数,成了鉴别套壳...07-24
- 任性但不失体面、风流但不下流的...07-24

