本页为摘要版;自2026年9月起,非日语版以摘要形式发布。完整附录以日语发布:全文(日本語)。本页所有数值与日语原文一致。
Kääselä Monthly Report 全号共同参照的固定附录。各号正文不再复述方法论,直接链接到本页。
1. 为什么要测波动幅度
生成式AI对同一个问题,不一定每次返回同样的答案。某个月的观测里「AI的引用变了」,究竟是真的变化还是单纯的生成波动,只有先知道波动有多大才能判断。本调查把这个波动的幅度称为「波动幅度」,先实测、公开,再作为解读月度差异的基准线。与只跑一次(n=1)就断言「AI是这么说的」的商用工具的区别,就在于自己测出并公开了这条基准线。
2. 测定方法
每条查询在同一条件下(ChatGPT・GPT-5.5・网页版・临时对话・关键词型查询・于京都市内执行)连续执行20次(n=20),逐次记录被引用的信息源域名集合。两次执行之间引用来源集合的重合程度用Jaccard系数(交集÷并集)表示:越接近1.0表示每次引用同样的来源,越接近0表示每次几乎整个换掉。
3. 12格的波动幅度(Jaccard系数)
| 日语 | 英语 | 简体中文 | 繁体中文 | |
|---|---|---|---|---|
| 茶道 | 0.25 | 0.20 | 0.31 | 0.25 |
| 和服 | 0.41 | 0.16 | 0.15 | 0.11 |
| 坐禅 | 0.35 | 0.40 | 0.22 | 0.23 |
波动幅度因类目和语言而异,不能用单一阈值套用到所有格。
4. 判定阈值的事前登记
主指标(引用来源的类别构成比)的判定阈值逐格设定:从第0号数据(已剔除商家信息卡的口径)出发,以执行为单位做bootstrap(B=4000)求出各格95%区间的半幅;两个时点之间的比较,变动达到「半幅×√2(向上取整)」以上才视为信号。最初的登记(全格一律±10pt・跨期14pt)是在把商家信息卡计入引用的口径下算出的,随卡片分离(第2版订正)作废,并仅用第0号数据、在未汇总任何第1号数据的状态下逐格重新推导。不会在看到观测结果之后再调整阈值。
| 跨期阈值(pt) | 日语 | 英语 | 简体中文 | 繁体中文 |
|---|---|---|---|---|
| 茶道 | 15 | 9 | 10 | 15 |
| 和服 | 17 | 16 | 23 | 22 |
| 坐禅 | 14 | 13 | 18 | 14 |
单个商家的出现率比类别构成比波动更大(约±22pt),月度评估只看上位集团的集中度。
5. 引用来源六分类的定义
| 类别 | 定义 |
|---|---|
| 公共 | 地方政府、观光协会、公共团体、公立文化设施 |
| 商家官网 | 回答中被推荐的商家、寺院或个人导览者本人运营的页面(有无预约功能不问) |
| OTA | 汇集他者库存、可在自身网站完成预约的第三方平台 |
| 媒体 | 自身网站不能预约、向外部引导的编辑内容(含联盟营销) |
| 目录 | 跨域汇总、不收佣金的名录 |
| UGC | 用户投稿 |
6. 方法论的限界
通过普通UI的观测只能捕捉回答里实际引用的页面,捕捉不到AI检索时参照的候选页面群,因此本调查一律使用「出现率」、不使用「选择率」。这里说的可复现,指的是在同一时间窗、同一引擎版本、排除个性化的条件下得到统计上一致的分布,而不是逐字一致的回答。完整讨论见日语全文§6。
本页是 Kääselä(Kamogawa AI Search Lab)个人研究项目的一部分。数据以CC BY 4.0无偿公开,不出售。