绝代双骄

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜_我的网站

战国

A |     昨天看到了一篇论文,特别有意思,让我连夜读完了。    “AI原生100”是科技组推出针对AI原生创新栏目,这是本系列的第「26」篇文章。    论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。         这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。                   2024年,一家名为Granola的初创公司以极简主义理念和精准的用户定位,迅速在AI会议笔记领域崭露头角。                   Granola于2024年5月正式推出产品,仅用5个月便完成A轮融资,并保持着每周10%的用户增长率。    就是:     “给我一个1到100的随机数。2025年5月,Granola完成4300万美元B轮融资,估值达到2.5亿美元。在资本和用户的双重驱动下,这家年轻公司迅速成为AI办公工具赛道的黑马。”          就像这样,比如我去试了一下,Claude Fable 5的回答,是73。                   Granola的定位十分明确:一款专注于会议场景的AI笔记软件。                   传统会议工具往往强调实时转录或完整留痕,这种方式虽然能减轻记录负担,却也在某种程度上把思考与筛选外包给了AI。    然后,每个模型问了30遍。

B |          再把每个模型的回答统计了一下分布。这样一来,用户在会后依旧要面对冗长的语音或逐字稿,还要花费额外精力去寻找重点。         结果出来以后,太好玩了。         GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。         Claude Sonnet 5更离谱,30次回答里疯狂输出47。                   嘉和资本CEO袁子恒告诉,Granola的亮点在两个方面,一是产品创新,二是发展战略。    Llama 3.3,则多数是53。    然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。

C |          随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。产品创新在于Granola将选择权交给用户,用户来选择记录重点,AI自动补全上下文。    但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。                   另外,袁子恒表示,Granola的发展战略也很清晰,首先是从ToC到To B,早期其面向硅谷VC、创始人等高频会议人群,口碑快速传播,然后拓展到企业高管、销售、HR等企业用户;其次是从工具到平台,2.0版本的Granola,新增了共享文件夹、Slack集成、跨会议主题分析等功能,从个人工具转向企业级协作。    而且非常好玩的是,每个模型的执念都不一样。可聚合多场会议数据进行分析,挖掘对话中的隐性知识资产。

D |     GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。

E |     就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。    而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。形成“对话数据-结构化知识-决策支持”的闭环;第三,Granola构建了开发者生态,将会议数据结构化,开放API接口供外部工具调用。如HR SaaS可通过API提取对面试者的评估。

F |          结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。

G |     当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。    确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。                   极简主义与会议痛点:为什么选择这个赛道?                    “我们意识到,实时转录会让人分心。用户本应专注于对话,却不得不时刻检查转录准确性,这违背了会议的初衷。”Chris Pedregal曾在采访中提到的这一点观察正是其产品形态选择的原因。

H | 2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。                   会议是现代职场中信息密度极高却很容易成本沉没的环节,冗长的会议录音、会后琐碎的整理工作宛如时间黑洞,悄悄吞噬着每一个高强度工作者的注意力。    但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。                   Chris敏锐地看到了其中的结构性机会:会议本身具有的高频刚需、明确时长、关键词触发、具备上下文依赖性等特征天然适合AI嵌入。而2023年ChatGPT之后的生成式AI浪潮,更让Chris看到了AI会议助手从“智能记录”跃迁到“增强思考”的可能性。                   传统工具如Otter.ai、Fireflies等往往依赖机器人入会、实时转录、保存会议录音来减轻记录压力,但这些功能也带来了一系列隐患:                    1. 隐私风险:录音上传、自动入会容易触发数据泄露或合规问题          2. 分心体验:实时转录要求用户不断关注准确性,反而影响专注力          3. 决策外包:AI主导转录内容排序,削弱了用户对重点的判断与掌控                    Granola刻意回避了这些传统路径。    所以说,为啥布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了???     那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证,看看中转站有没有偷偷在我们买的模型里掺水呢?     于是,在一系列的实验以后,这篇论文面世了。上线前,它主动砍掉非核心功能,仅保留会后笔记生成和AI互动。用户被鼓励在会议中保留自己的手动笔记,无论是情绪、灵光一现的思路,还是零散的to-do,这些碎片化信息与转录文本一同输入系统,再由LLM重组、提炼,生成独属于用户的个性化笔记。                   会后,用户无需再翻阅冗长逐字稿,而是可以直接对AI提问:“客户的反对点有哪些?”“我承诺了什么?”“下一步该怎么做?”AI则像一位聪明的助理,从原始语境中提炼关键信息,提供上下文联动的精准回应。

I |          布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。    就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。                   会议中没有打扰,会议后却能立刻交出个性化洞察。

J |     只需要模型输出一个 Token,就够锁定你是谁。这种极简、克制、透明的产品哲学,成为Granola区别于同类产品的最大特征。    这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。         大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。         上次Anthropic大面积封号的时候我也聊过这事。         但这个生态里,有一个几乎所有人都在默默忍受的问题。         你付了Claude Opus 4.8的钱,你收到了一段回复。                   从产品设计到用户体验,Granola始终坚持一个核心理念:AI不是替代人,而是增强人。         但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。         这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。正是这一产品理念,让它快速验证了产品市场契合度(PMF),并在AI会议工具赛道中成功闯出一条以用户体验为核心的蓝海路径。                   用直觉做产品:从谷歌产品经理到Granola的诞生                    Granola创始人兼CEO Chris Pedregal的个人经历为这款产品注入了极强的现实洞察力。         那时候,一群来自CISPA的研究人员就审计了17家中转API。他曾在谷歌担任产品经理(PM),长期沉浸在从早到晚的会议日程中,深切体会到会议对深度思考的挤压与吞噬。也正是这种亲身经验,促成了 Granola的初衷:打造一款真正让人回归思考本质、从记录中解脱出来的会议工具。                   Chris清楚地知道,一款理想的AI工具不应只是更快地输出,而是应该增强用户的判断力与思维深度。         他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。因此在Granola的产品理念中,有五条贯穿始终的隐性法则:                    1. 产品必须有“灵魂”(soul):不是为了迎合反馈做妥协设计,而是清楚知道产品想表达什么、该坚持什么。         2. 保持个性化与上下文意识:不提供千篇一律的摘要,而是让AI理解用户的语境、优先级与语气,生成属于个人风格的笔记。

K |          有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。         而且这事之所以这么普遍,纯粹是经济结构决定的。         推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。         省下来的差价,就是纯利润。         3. 与用户深度对话建立“产品直觉”:比起看图表,创始人更相信亲自和用户对话,从中捕捉更真实、更具洞察力的信号。

L |          4. 拥抱实验成本,利用用户少的杠杆:早期用户量少,反而可以大量使用最前沿模型(如GPT-4),做“昂贵但高价值”的试验,而不怕推理成本炸裂。         5. 快速试错,像小孩玩玩具那样探索技术边界:保持对AI能力的好奇心与开放性,不因路径依赖而放弃可能的跃迁。         只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。                   这些理念并不是纸上谈兵。2024年Granola产品上线时,团队只有四个人,这种极小规模让他们得以迅速试错、专注打磨核心功能。         所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。         但问题在于,CISPA这套LLMmap的方法依然很重。例如团队曾测试过“实时转录”功能,但在真实使用场景中发现它反而分散了用户注意力,于是果断砍掉,转向了更贴近思维节奏的“会后处理”模式。                   Chris强调,小团队让他们得以与用户保持更亲密的关系,最大程度避免了冗余判断与内部政治。上线初期,Granola就建立了与用户一对一深度交流的机制,有时甚至是面对面沟通,产品负责人和工程师都可以直接面对真实反馈。

M | 这帮助团队建立起一种独特的“产品直觉”:知道什么功能真正重要,也知道哪些功能必须坚持、哪些必须砍掉。

N |                    为了进一步接近真实使用场景,Granola在产品开发过程中采用了一种极简但极有效的“点图仪表板”(dot dashboard),这是整个产品开发期间唯一被允许使用的数据工具,贯穿了一整年。这套由顾问David Lieb引入的点图系统,每一个点代表一次真实用户的会议行为,团队每天都点开来看:用户有没有做笔记?有没有向AI提问?有没有完整参会?有没有偏离预期路径?这些细微行为成为产品迭代的第一手依据。                   相比传统BI工具的宏观报表,点图不仅强化了Granola团队对于真实行为的感知,也深化了产品与用户之间的连接机制。                   这种“坚持风格+深入用户+拥抱实验”的混合方法论,逐渐内化为Granola的产品哲学,最终呈现的,是一个功能不多但精准有效、以人为本的AI办公工具。         你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。         布鲁克纳真正牛逼的地方就在这里。         他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。                   Granola在2.0版本中推出了一系列增强功能,进一步扩展了智能会议助手的边界,包括:自定义笔记模板(匹配不同会议类型)、多人协作文件夹(支持标签与引用跳转)、Chat with folders(跨文档语义检索会议共识),以及与Slack等工具的集成,可自动续写任务与邮件,打通了从会议到行动的链路。                   Granola官网                    VC即用户:Granola的冷启动                    Granola的冷启动策略非常精准,一上线便直接瞄准VC、公司高管等高净值、多会议人群,其早期用户画像包含十余家独角兽公司的创始人、顶级VC合伙人以及《财富》500强的高管。         就问AI,给我一个随机数,然后数它的回答。可以说,Granola从一开始就选择了最挑剔也最有潜力带动传播效应的那一批人。                   这种策略为Granola带来了双重回报:一方面,高净值用户的付费意愿和产品黏性本身就远高于平均水平,为早期营收提供了稳定支撑;另一方面,这类用户的活跃本身就是品牌背书,一旦他们认可某个工具,便会在投资圈与创业社群中自然扩散,形成口碑飞轮。         而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。

o |                    Granola的两位创始人                    Chris还谈到过一个“VC陷阱”。         传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。通常情况下,VC在评估产品时容易过度依赖数据与商业模型,却忽视了产品本身的使用体验;但Granola巧妙绕过了这一陷阱——让VC们成为用户,亲身体验产品。         但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。这使得很多投资决策不再依赖冷冰冰的分析,而是源自于“它确实好用”的直觉共识,快速拉动融资。                   而这种高度契合的用户群体,也为Granola埋下了极强的粘性基因。自2024年5月推出以来,Granola用户基数增长5倍,每周约5000活跃用户,拥有70%以上的每周活跃留存率,这些数据说明Granola并非尝鲜即弃的工具,而是真正嵌入到了用户的日常工作流之中。                   Granola的官方博客也指出,有一半以上的用户在第10周仍在使用产品,且平均每周参与6场会议。这一粘性表现远超许多同类工具,背后反映的,是Granola在用户体验与需求抓取上的打磨。

p |          而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。         他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。                   产品上线后数月内,Granola先后顺利完成多轮融资,部分原因正是因为投资人早已是产品用户,天然减少了尽调阻力。         用全部40个探测单元跑完,验证的准确率能到什么程度呢。尽管融资顺利,Chris的初心依然明确:与其一味追求用户规模,Granola更关注能否在这个信息爆炸、思考被稀释的时代打造出一个真正“让人更加专注”的会议助手。                   Granola采用订阅制收费模式,面向个人与企业两端开放,目前提供免费试用、个人版(每月18美元)和企业版(每人每月14美元)。         大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。付费计划支持无限会议、团队文件夹、多端协作等功能,而免费用户则有使用次数和功能的限制。Granola最初在2024年5月以免费形式开放测试,并在试用期结束后正式迈入商业化。

q |                    AI的“方向盘时刻”:行业竞争与风险                    AI会议记录工具始终是AI办公赛道中的重要一环,各类平台都在争夺这个入口,除了Otter.ai、Fireflies.ai、Supernormal、Notion AI等早期布局者,新的工具如Granola也在不断加入。

r |          这个跟上文我们提到的LLMmap的准确性已经差不多了,但是要简单太多了。

s |          而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。Zapier在2025年的工具评选中把Granola放进了前九名会议助手行列。                   不过,Granola所在的,是一个越发拥挤的赛道——目前有太多AI会议纪要产品,我们“AI原生100”栏目曾分析过Cluely,势头也很猛。                   袁子恒说,Cluely的应用场景更多,不仅限于会议纪要,其创新是AI的实时提示,这与AI会议纪要有很大差别。

t |                    与Cluely相比,Granola则走了另外一条路,他们训练了很多细分行业的模型,开发了销售、招聘等20多个行业模版,例如投资人访谈模版——可以识别投资条款;销售复盘模版,可识别客户对话中的风险信号;医疗行业模版,可识别专业术语。         一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。         但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。                             “We shape our tools and thereafter our tools shape us.”(我们塑造了工具,而后工具也塑造了我们。         布鲁克纳的系统会给任意两个模型的指纹算一个相似度分数,数字越小代表越像。)这是Chris认同的技术观之一。

u |          同一个模型在两个不同供应商那里各部署一套,因为服务器环境不一样,两边的指纹也不会100%一致,这种自己跟自己比的正常波动大概是0.140。Chris认为理想的人机关系应该是人与AI在同一个画布上协作,他曾聊过一个有趣的比喻:早期汽车没有方向盘,而是用一根控制杆来驾驶。如今大多数AI产品仍像是在用控制杆把用户拖拽着走,我们要做的,是给用户装上真正的方向盘。         Palmyra X5跟Qwen3-235B的差距是0.141,和一个模型自己跟自己比的波动几乎一模一样。                   正如他们的核心愿景:“AI不是替代,而是增强。”Granola不愿成为一个无处不在的干扰者,而是愿意成为一位隐藏在身后的专注引擎,用最安静的方式,让用户在这个信息爆炸的时代把“方向盘”和注意力还给自己。

v |                    对中国创业者的启发                    袁子恒聊过了许多国内的AI创业者,他发现对于Ai应用而言,技术、产品和增长是三个关键支柱。

w | 目前,Vibe coding极大降低了产品开发的门槛,因此对于用户痛点的挖掘,对垂直场景的洞察要求更高。有一些国内的AI创业者忽略了商业模式的重要性,很多人想的是走一步看一步,没有建立完整的全局观,如果想的足够透彻,执行就会更加坚决。                   对于诸如Granola这类的AI会议纪要产品,袁子恒认为,未来的机会点,还是在于从用户需求出发,从人机协同的角度出发,从提升精准度出发,从节约用户整理会议纪要时间的角度出发,探索一些更垂直的场景,并且一定要融入到B端工具的生态中。

x |                    在与交流中,袁子恒提到了一个观点,Granola的模式在国内如果能做起来,应该也是互联网大厂的机会,像钉钉已经推出了AI录音卡片。

y |          这下事情就非常的尴尬了。目前他观察到Plaud在海外也是这个方向,只不过是通过AI硬件从个人用户开始进入到企业客户。                   对于AI创业者,袁子恒的建议是一定要做出海,因为国内的C端用户付费意识和付费能力比较弱,很难实现收费,而国内的企业用户,对于AI产品普遍要求私有化部署,和上一个Saas时代一样,很难有爆发式增长。                   目前袁子恒做的事情,就是帮助做AI应用出海的创业者找到商业模式、找人、找钱、找资源。他都建议AI创始人做出海,因为海外用户的付费意愿和付费能力比较强,To B生态圈也很发达,创业公司只要找到一个生态位就可以发展的很好。

z |                    文章标题:4人团队一年估值2.5亿美金,一款产品征服投资人          文章链接:https://www.huxiu.com/article/4794049.html          阅读原文:4人团队一年估值2.5亿美金,一款产品征服投资人_网。         布鲁克纳在论文里措辞很克制,说这只是统计性观察,不是对意图的指控。

|          但是,数据和代码全部公开,任何人都可以复现。         网址在此:https://zenodo.org/records/21278557          整套东西,非常有意思,而且不止数字,还有颜色等等等等,这个扩展性和上限,我觉得极高。         模型的随机并不随机,给了这种行为指纹非常值得探索的空间。         我觉得比审计结果本身更好玩的,是一个更底层的问题。         AI为什么就是不能生成真正的随机数。

|          之前帮影视飓风弄了个视频,就聊过这个话题,在AI视频里抛硬币,其实概率根本不是55开,是73开。

|          在这个布鲁克纳的测试里,也是一样的。

|          1到100的随机数这个任务的标准答案,所有人都知道,应该是均匀分布,100个数字每个被选中的概率严格1%。         但165个模型,一个都没做到。

|          论文里用了一个叫熵的指标来衡量回答到底有多随机,应该有无数人见过。         这玩意你可以简单理解成不可预测程度,数字越高代表越难猜,越接近真正的随机。

| 如果1到100的分布是完全均匀的,熵应该是6.64 bit,也就是你几乎没法猜到下一个数字是什么。         但165个模型的中位数只有1.0 bit,差了五六倍。         AI回答随机数的时候,信息量只有真随机的六分之一,高度集中,高度可预测,高度非随机。         其实这个事,心理学和行为经济学研究了很多年。

|          不光AI,人类也不会生成随机数。         有一个经典实验,让一群人闭上眼睛说一串随机数字,结果呢,发现人类非常强烈的倾向避开重复、避开相邻数字、偏好奇数。         你让100个人说一个1到10的数,7被选中的概率远远高于10%,因为人脑觉得7看起来比较随机,而5和10看起来不够随机。         大家可以回想一下,自己是不是这样。         我们看到的绝大多数随机,可能只是隐藏因果关系在认知中的投影。         AI面临的是一模一样的困境,只不过原因不同。         真正的随机,要求你是一张白纸。         但大模型恰恰是人类有史以来造出来的信息密度最高的非白纸。

|          训练数据是数十万亿的token,几千年文明的总和。         每一个权重参数都编码着某种规律、某种偏好、某种从语料里沉淀下来的肌肉记忆。         所以你让它随便说一个数,它根本没法真正随便。         它只能从自己见过的所有文本里,找到一个最像随机数的答案。         42为什么被那么多模型偏爱?          因为它是《银河系漫游指南》里“生命、宇宙以及一切问题的终极答案”。

|          7为什么总被人类选中?          因为它在宗教、文化、文学和日常语言里,被反复赋予神秘、幸运和特殊的意义。         37、47、53这些数字为什么频繁出现?          因为它们是奇数,是质数,不圆整,不对称,看上去更像一个没有经过思考、随手蹦出来的数字。         可恰恰因为所有人都觉得它们更随机,它们才变得最不随机。

|          大模型只不过把人类潜意识里的这种偏见,压缩、放大,然后写进了自己的概率分布里。         我们总觉得模型是一个冷冰冰的数学机器,每次回答都来自概率采样,充满不确定性。

|          但当你把几十万次回答遍历回测,把那些看似随意的选择叠加在一起,你会发现它其实一点都不随意。         它们也有自己的偏爱,有自己的执念。         参数可以被量化,系统提示词可以被修改,名字可以被重新包装,外面甚至可以套上一层完全不同的壳。

|          可它在亿万次训练中形成的概率习惯,依然会从一个小小的Token里漏出来。         爱因斯坦说过,上帝不掷骰子。

|          而AI,也不掷骰子。         它每一次以为自己在掷骰子的时候。         掷出来的,都是自己。         >/ 作者:卡兹克。

Current article:http://www.yuejinhuapennuochoudengying.cyou/tq4jtyo/20260826/11819.xlsx

Published on:08:53:37


我的网站最近更新

我的网站热门资讯