附录:波动幅度的测定方法与引用来源六分类

Kääselä Appendix 2026-08 全号共用的固定附录 摘要版・阅读约2分钟

本页为摘要版;自2026年9月起,非日语版以摘要形式发布。完整附录以日语发布:全文(日本語)。本页所有数值与日语原文一致。

Kääselä Monthly Report 全号共同参照的固定附录。各号正文不再复述方法论,直接链接到本页。

1. 为什么要测波动幅度

生成式AI对同一个问题,不一定每次返回同样的答案。某个月的观测里「AI的引用变了」,究竟是真的变化还是单纯的生成波动,只有先知道波动有多大才能判断。本调查把这个波动的幅度称为「波动幅度」,先实测、公开,再作为解读月度差异的基准线。与只跑一次(n=1)就断言「AI是这么说的」的商用工具的区别,就在于自己测出并公开了这条基准线。

2. 测定方法

每条查询在同一条件下(ChatGPT・GPT-5.5・网页版・临时对话・关键词型查询・于京都市内执行)连续执行20次(n=20),逐次记录被引用的信息源域名集合。两次执行之间引用来源集合的重合程度用Jaccard系数(交集÷并集)表示:越接近1.0表示每次引用同样的来源,越接近0表示每次几乎整个换掉。

3. 12格的波动幅度(Jaccard系数)

日语英语简体中文繁体中文
茶道0.250.200.310.25
和服0.410.160.150.11
坐禅0.350.400.220.23

波动幅度因类目和语言而异,不能用单一阈值套用到所有格。

4. 判定阈值的事前登记

主指标(引用来源的类别构成比)的判定阈值逐格设定:从第0号数据(已剔除商家信息卡的口径)出发,以执行为单位做bootstrap(B=4000)求出各格95%区间的半幅;两个时点之间的比较,变动达到「半幅×√2(向上取整)」以上才视为信号。最初的登记(全格一律±10pt・跨期14pt)是在把商家信息卡计入引用的口径下算出的,随卡片分离(第2版订正)作废,并仅用第0号数据、在未汇总任何第1号数据的状态下逐格重新推导。不会在看到观测结果之后再调整阈值。

跨期阈值(pt)日语英语简体中文繁体中文
茶道1591015
和服17162322
坐禅14131814

单个商家的出现率比类别构成比波动更大(约±22pt),月度评估只看上位集团的集中度。

5. 引用来源六分类的定义

类别定义
公共地方政府、观光协会、公共团体、公立文化设施
商家官网回答中被推荐的商家、寺院或个人导览者本人运营的页面(有无预约功能不问)
OTA汇集他者库存、可在自身网站完成预约的第三方平台
媒体自身网站不能预约、向外部引导的编辑内容(含联盟营销)
目录跨域汇总、不收佣金的名录
UGC用户投稿

6. 方法论的限界

通过普通UI的观测只能捕捉回答里实际引用的页面,捕捉不到AI检索时参照的候选页面群,因此本调查一律使用「出现率」、不使用「选择率」。这里说的可复现,指的是在同一时间窗、同一引擎版本、排除个性化的条件下得到统计上一致的分布,而不是逐字一致的回答。完整讨论见日语全文§6

本页是 Kääselä(Kamogawa AI Search Lab)个人研究项目的一部分。数据以CC BY 4.0无偿公开,不出售。

Top