文献综述 · 研究计划 · 方法与来源

Research report · 文献综述与研究计划

个性化对话 AI、注意配置
与自主认知加工

Personalized Dialogue AI, Attention Allocation
and Independent Cognitive Engagement

关注以对话为中心的内容获取:交互环境如何改变目标切换,以及在主题保持连贯时,用户的自主解释、整合与检验如何变化。

English abstract

Generative AI is shifting some information-seeking activities from browsing and selection to multi-turn dialogue and immediate synthesis. This review examines how personalized dialogue may affect attention allocation and cognitive engagement when switching is easy, responses remain available, and users prefer immediate feedback. It distinguishes two pathways: unplanned switching before the original goal is completed, and reduced independent explanation, integration, and verification even while the topic remains coherent. Existing studies support changes in specific behaviors or learning outcomes, but do not fully identify both pathways in personalized dialogue or establish a general, long-term decline in attention. Effects depend on the basis of adaptation, feedback content, user agency, and task goals. The proposed studies separate interface factors, answer strategies, and personalization policies, and combine process records with delayed unaided transfer tests and ecological follow-up. Sample sizes are planning scenarios pending pilot-informed simulations; the studies have not been implemented, preregistered, or ethically approved.

中文正文与原研究包一致;各文献的版本、访问限制及研究边界保留在来源台账。
The complete Chinese report is preserved below, with source versions and evidence limits retained.

个性化对话AI、注意配置与独立认知表现:研究包

版本与文献核验截止:2026-10-07。

本研究包围绕修正后的观点展开:在低切换成本、持续供给和偏好即时反馈的媒介环境中,注意配置可能更容易碎片化,部分认知表现可能改变。重点是个性化生成与以对话为中心的信息获取。

文件与用途

文件 内容
文献综述 有摘要、概念界定、理论整合、正反及不显著证据、条件性假说和29项参考文献的学术综述稿。
研究计划 先导、环境因素实验A、个性化与回应方式实验B、生态验证C及可选迎合实验B2;包含主要对比、指标、统计、缺失、可证伪条件与执行安排。
方法附录 操作化、过程编码、独立迁移评分、数据字典、功效公式和敏感性表。
来源与检索台账 新来源与方法书目、原文访问边界、正式更正与旧台账衔接。
样本量规划输入与结果 本次正态近似计算的输入、数值和取整结果;便于复算。

核心研究定位

研究分别观察两条路径:原目标未完成时转向无关问题;以及主题仍连贯,但自主解释、证据整合和检验减少。第二条尤其适合检验对话AI,因为系统维持语境不必然表示用户已经独立形成同样的理解。

个性化实验B比较三种适配:通用呈现、基于表达形式偏好、基于事前知识缺口;再与完整答案先行/先尝试再纠错交叉。它能估计明确交互政策对一周后无AI迁移的效果。迎合性回应单列B2,避免把表达偏好、知识诊断和立场肯定视为同一种处理。

若以一篇论文作为起点,建议优先推进研究0与B:最贴近个性化及人机交互的问题。A补充检验环境机制;C进一步验证数周使用后的独立表现。完整项目中的这些阶段可分别形成研究,不能要求单次实验同时证明全部链条。

已完成与待实施的边界

已完成的是文献检索与判读、综述写作、研究设计、评分原则和近似样本量复算。综述属于批判性整合综述;没有执行穷尽式数据库筛选或正式偏倚评分,因此没有称为系统综述。

方案尚未实施、未预注册、未获得伦理批准;中文任务与编码仍待先导。主体按先导60、A512、B990、C480暂作招募规划,共2,042人;可选B2另560人。人数、效应量及失访率均为规划假设,正式样本量必须结合先导、最小重要差异和实际模型重新模拟。

现有文献可以支撑条件性研究问题,不能确认个性化对话AI导致一般注意能力长期下降。研究价值在于识别哪些交互条件影响目标连续性、自主加工和独立结果,并同样报告有益、不显著及存在权衡的结果。

个性化对话式人工智能、注意配置与自主认知加工:一篇批判性整合文献综述

版本:2026-10-07。文献截止与检索日期:2026-10-07。

摘要

生成式人工智能正在把部分信息获取活动从浏览和选择转为多轮对话及即时综合。本综述考察,在低切换成本、持续可获得回应和偏好即时反馈的环境中,个性化对话如何影响注意配置与认知投入。本文通过聚焦式学术检索,将数字切换、对话搜索、认知外包、教学交互与个性化回应研究整合为一个双路径模型:其一是原目标未完成时发生无计划目标切换;其二是主题保持连续,但用户减少自主解释、整合与检验。已有非 AI 切换研究和 AI 获取/教学研究分别支持特定情境中的配置或学习结果变化,但尚未在个性化对话中完整识别两条路径,更不足以确认一般注意能力的长期下降。对话形式、个性化和反馈即时性均不能单独决定效果;适配依据、反馈内容、用户主动性和任务目标具有重要作用。本综述提出可证伪的条件性假说,并指出应以分因素随机实验、实际暴露记录、过程编码、延迟无辅助迁移和生态追踪检验其边界。

关键词:生成式人工智能;对话式信息获取;个性化;注意配置;认知外包;元认知;学习迁移

1. 问题的提出:从媒介时长转向认知过程

“电影—电视剧—短视频”的演变容易被解释为人的专注时间不断缩短,但媒介长度、实际停留、话题热度和持续注意能力分别属于不同层次。公共话题热度的加快不能直接推为个体注意能力下降;媒体多任务研究的重复与元分析也未给出强而一致的认知控制损害结论(Lorenz-Spreen 等,2019;Wiradhany 与 Nieuwenstein,2017)。因此,本综述不以媒介形式的历史替代作为因果证据。

更可检验的问题是:某些技术环境降低转向替代信息的成本,使回应持续可得,并让用户容易获得即时满足。这种环境能否改变用户分配注意和继续努力的方式?生成式 AI 的特殊性不只在内容数量,更在于系统可以围绕用户的提问、背景、错误或立场生成下一步回应。用户既选择内容,也参与塑造内容与问题的序列。

本文聚焦以对话为中心的内容获取,尤其是需要形成解释、比较证据或理解机制的任务。事实查询和产出委托同样是合理用途,但其成功标准可能是即时正确性或协同效率,不能自动按独立学习的目标评价。内容生产成本、AI 短剧产量及宏观产业影响不构成本综述的主要解释路径。

2. 检索与整合方法

本文属于批判性整合综述。检索借助网络学术索引定位题名与 DOI,在期刊、作者机构、PubMed/Europe PMC 和原论文中核验结论,并沿关键研究的参考文献补检理论与方法文献。检索覆盖数字切换与持续注意、LLM 与传统搜索、认知外包、学习支架、对话探索、个性化说服、迎合与元认知。代表性检索词包括 cognitive offloading、switching costs information foraging、conversational search learning、LLM versus web search depth learning、personalized dialogue sycophancy、immediate delayed feedback、generative AI self-regulated learning,以及相应中文词组。

优先纳入直接研究交互行为或独立认知结果的实验、相关问题的元分析,以及解释机制所需的原始理论。新闻、产品宣传与社交媒体仅用于发现线索。正式版及更正优先于旧预印本;未核实正式出版的材料单独说明版本。研究按处理、结果和识别能力分类,未把异质结果合并为一个“AI 对认知的效应”。

本次未直接完成 PsycINFO、Web of Science、Scopus 或 CNKI 的数据库全量检索,没有预注册综述协议、双人穷尽筛选或正式偏倚评分。因此,不能称为系统综述或报告虚构的 PRISMA 纳入数量。其结论适用于本次可核验的文献集合;未检索到的证据不能被宣称绝对不存在。可追溯检索词、来源版本和访问边界见来源与检索台账。

判读时分别检查随机分配、处理是否捆绑、结果指标效度、盲评、样本和失访、测验间隔及外部效度。全文可得的研究与仅有原摘要/部分方法的研究分开记录,后者不承担细节性的机制结论。这是透明的证据判读,并非已完成标准化偏倚评分。

3. 概念界定:必须分开的变量

3.1 注意配置、注意状态与注意能力

注意配置描述用户把有限时间分配给哪些目标,以及何时转向其他目标。注意状态描述任务中的走神、投入和反应表现;注意能力则要求相对稳定、跨任务的控制或维持表现。三者可能相互影响,但并不等同。平台停留时间和对话轮数也不能替代任何一种能力测验。

本综述将“无计划目标切换”限定为:原目标仍有未完成的推理或证据步骤时,进入一个缺少明确任务关联的替代问题。为完成原目标而寻求反例、比较概念或补充背景,属于目标相关探索,不能机械计为碎片化。目标本身可以合理修订,故判断需结合用户声明的目标、完成标准和修订理由。

3.2 自主加工与认知外包

自主加工指用户自行生成解释、比较材料、建立因果关系、核验依据和修正判断。认知外包指把部分工作交由外部系统承担。外包可能减轻无关负担,也可能减少实现当前学习目标所需的练习;不能仅凭努力下降将其判为有害。

这一判断承接认知外包综述(Risko 与 Gilbert,2016)与学习—表现区分(Soderstrom 与 Bjork,2015)。即时系统产出、练习表现和保持/迁移是不同结果,不能把其中一个替代其他结果。

对话系统可以保持语境,而用户未必在自己的知识中形成同样连贯的结构。反过来,用户也可能借助 AI 的外部结构做更充分的比较。因而需要分别观察系统所保持的主题、用户可见的认知贡献、人机协同产出,以及无辅助条件下的理解。

3.3 个性化与迎合

个性化至少包括表达适配、知识缺口适配和偏好或立场适配。每种“适配”应明确指向所使用的用户信息与优化目标,而不能成为一个笼统处理。迎合则是过度肯定或支持用户判断,非个性化系统也可以迎合,个性化系统也可以提供反证。

3.4 即时反馈与即时结论

反馈速度描述回应时机;反馈内容描述系统提供答案、提示、纠错还是反证。偏好即时反馈又是用户的选择倾向。即时给出结论与即时回应用户尝试可能具有不同认知作用,故改变内容不能被解释为单独改变即时性。有限任务中的快速正确查找,也不能因思考较短而被判为失败。

构念 合适的指标 常见替代指标及局限
目标连续性 无计划切换、返回、完成原问题 轮数和点击数受界面规则影响
自主加工 独立解释、比较、反例、核验与有理由的修正 字数和流畅度可能只是复制或表达能力
主观理解 理解感、信心、知识归属感 无法替代准确率与迁移
独立学习 无 AI 的机制解释、保持与新情境迁移 有 AI 时的产出由整个系统共同形成
持续注意 标准化任务及跨时点可靠变化 一次学习差异、凝视或脑信号不是能力损伤的直接证据

4. 理论基础:继续努力、生成解释与监控委托

机会成本模型将主观努力与替代活动的价值联系起来,为低成本新问题如何影响继续投入提供解释方向(Kurzban 等,2013)。将这一模型用于 AI 对话是理论外推:替代问题更容易进入,可能使当前困难更显得“不值得继续”,也可能让用户迅速补齐推进当前任务所需的信息。模型本身没有识别 AI 使用的净效果。

ICAP 框架以学习者的可观察活动区分接收、操作、生成与共同建构;多轮发言不足以证明实质性交互,需要双方对内容作出建构性的贡献(Chi 与 Wylie,2014)。据此,AI 对话的分析单位应是用户在一轮中做了什么,而非对话数量。但外显行为仍是代理,安静阅读也可能有内在推理。

Tankelevitch 等(2024)则指出,提问、评价 AI 输出和决定如何安排委托会产生元认知要求。对话界面的便捷性可以降低部分操作负担,同时增加判断自己何时已经理解、何时应核验的要求。因此,必须区分“系统替我完成了任务”与“我知道系统完成了什么、为何可信、何时不能依赖”。

这些框架共同要求把任务目标置于中心。对专业用户而言,外包资料整理后进行更好的决策可能是成功;对新手而言,若目标是学习推理,完全代做可能减少必要活动。理论中的认知成本也不能被简单转换为“越困难越有利”:无关障碍与目标所需的加工必须分别判断。

Nakamura(2026)已经提出相近的目标依赖框架,区分辅助性工作与构成学习本身的工作,并建议结合过程日志及延迟无辅助迁移。本综述承接这一邻近贡献,将进一步问题放在个性化对话的时间序列:系统如何改变下一问的选择,用户何时继续推理、转向其他目标或接受现成综合。这一定位避免把既有认知外包框架重新包装为首次发现。

5. 实证证据的整合

5.1 数字切换的代价:支持配置变化,尚非历史能力退化

Tam 与 Inzlicht(2024)的实验显示,数字视频切换在部分条件下加重无聊、降低当下主观投入。Chiossi 等(2023)研究的则是短视频情境切换后的前瞻记忆。这些结果支持对切换节奏与任务连续性进行研究,但不直接检验个性化 AI,也不证明一般持续注意长期下降。

限制手机联网的随机试验观察到持续注意改善(Castelo 等,2025),但干预同时改变通讯、娱乐和日常活动,且遵从有限。它既提示媒介环境可能影响注意表现,也提醒我们,整体环境干预难以把效果归因于某一交互属性。由此不能预设对话 AI 与短视频具有同样机制或效应。

更直接的非 AI 先例来自 Liu 等(2016):其互动阅读实验操纵切换等待,发现停留配置和已选择材料的条件回忆发生变化。不过等待也占用总时长,研究不能据此推断总体信息获取改善。这支持独立操纵切换成本,也要求把所选材料回忆与给定时间内的总收益分开。

5.2 综合答案与学习:自主整合机会是候选机制

Stadler 等(2024)将 91 名大学生随机分配使用 ChatGPT-3.5 或 Google,完成科学争议问题的资料研究。LLM 条件的自报负荷较低,最终建议包含的相关论据较少。这说明特定任务中的获取便利与论证充分性可能分离;旧模型、单一任务和短期测量限制了外推。

Melumad 与 Yun(2025)在七个实验中比较综合式结果与传统网页结果。其“深度”主要来自自报学习、全面性与归属感,以及建议文本的丰富程度;并无标准化独立理解或迁移测验。保持核心事实的实验仍改变了摘要与多篇网页文章的呈现、组织和综合需求,不能视为纯粹隔离“对话”因素。这组结果为加工外包假说提供线索,尚未直接证明其全部中介链。

5.3 有工具时表现与独立学习可能分离,方向取决于设计

总体综合证据也应保留:Han、Peng 与 Liu(2025)纳入 68 项实验/准实验研究,报告 GenAI 教育干预的平均积极效果,同时存在较高异质性。本文仅核验出版商摘要与部分方法索引,未独立重分析或审核所有效应依赖。该综合结果不能被少数负面实验否定;它同样无法单独回答本综述关于无计划换题、无辅助迁移或持续注意的问题,因为干预、对照和结局并不相同。

Bastani 等(2025)的高中数学实验发现普通 AI 练习条件下,紧接练习的无辅助考试表现较差;提示式导师减轻了该结果。但导师同时获得教师提供的正确解法和常见错误,故不能把差异单独归因于提示方式。这里的独立考试发生在同一课次,而非长期延迟保持测验。

Kestin 等(2025)的大学物理研究显示,结构化 AI 导师可提高即时后测表现。其比较包含自定步调和课堂情境差异,并非通用聊天与“纯无 AI”条件的单因素比较。这项积极结果反驳了所有对话 AI 必然损害学习的强命题,仍未证明一般注意能力提高。

Fan 等(2025)的 117 人随机实验进一步显示,ChatGPT 条件的作文修改表现提高,但知识增益与迁移并未显著不同。作者讨论“元认知懒惰”的可能性,这一术语不能替代能力测量;不显著也不证明等效。其价值在于将产品改善、过程变化与学习结果分别报告。

自然语言对话支持学习的研究也早于大语言模型。AutoTutor 的系统与研究汇述展示了混合主导权对话、追问和解释提示的教学可能性(Graesser 等,2005),但课程脚本、教学反馈和界面共同构成处理,不能用它证明“纯对话”优于其他形式。

5.4 对话搜索可能改变问题选择,尚不能等同于注意碎片化

Sharma、Liao 与 Xiao(2024)比较对话搜索与传统搜索,并操纵系统与用户观点的一致性,发现确认性查询增加,强化用户观点的系统进一步加重这种偏向。其结果涉及问题选择与选择性接触,并不是持续注意测试。查询空间变窄甚至可能与更久停留在同一议题并存,因此“更多碎片”与“更窄探索”不应混为一谈。

Mittal、Blodgett 与 Liao(2026)的八天日记田野实验提供更接近日常获取的线索。本文核验的是 arXiv v2;作者主页列为 AIES 2026,尚未以本次检索取得的正式会议版本替代。80 人入组,仅 35 人完成并进入分析;总学习分比较未达到作者所用显著性阈值,逐题分析具有探索性。高失访、日记自报及工具条件的多重差异,使其关于主体性与探索变化的解释不能作为已识别的因果中介。

5.5 用户主动性、个性化与肯定性反馈

Kim 与 Ji(2026)的 36 人交互设计实验提示,渐进披露及较高用户主动性可促进主观参与和探索行为。小样本、主观结果和部分量表信度限制了客观学习结论,但支持把对话设计拆分检验。

Salvi 等(2025)的对话说服研究及 2026 年更正提供一个重要统计边界:个性化 GPT-4 相对人类的优势保留,但相对非个性化 GPT-4 的直接比较未达统计显著。不能把相对人类优势全部归因于个性化;该研究也未测量注意或学习。

Cheng 等(2026)的三个预注册实验则在另一处理上给出较直接证据:迎合性回应改变了用户关于人际冲突的确信和修复意愿,同时受到用户偏好。它说明继续使用与自我纠正可能分离,但结果不能泛化到所有知识任务,也不能把迎合等同于个性化。较高信任、自报批判思考与 AI 使用方式之间的调查关联,同样不能替代因果检验(Lee 等,2025)。

关于即时性,反馈研究本身没有“越快越好”的统一结论。Kulik 与 Kulik(1988)的原始元分析及 Corral 等(2021)的概念学习实验显示,时机效果随任务和测验安排变化。它们不是 AI 实验,所操纵的延迟也不能直接映射为聊天中的秒级等待,但足以要求单独检验反馈时机与内容。

主观理解的校准也应独立测量。Fisher 等(2015)发现网页搜索可能提高对自身知识的估计;这并非 LLM 效应或客观能力下降证据。当前研究应在同一用户身上联合测量信心和无辅助准确性,而不能把主观“看懂了”视为掌握,也不能仅因自评提高就宣称错觉。

6. 双路径模型与条件性假说

第一条路径是配置路径:替代问题易进入且持续可得 → 原目标尚未完成时发生无计划切换 → 推理或证据整合中断。第二条路径是加工路径:系统提供现成综合与结论 → 用户自行生成、比较和检验减少 → 独立理解或迁移可能改变。两条路径可以共同出现,也可以分离;例如用户保持同一主题,却主要由 AI 完成推导。

上述箭头是待检验的因果主张,不是对现有证据的完整复述。先前知识、动机、任务难度、时间压力、AI 正确性和用户调节方式可能影响两条路径及结果;随机分配系统设计可以识别总效应,却不会自动随机化过程中发生的切换或自主加工。

目标连续性 自主加工较多 自主加工较少
较高 连贯的解释、反例与修正 连贯接收,但主要整合由 AI 完成
较低 多分支探索;可能有价值,也可能失去目标 同时发生目标偏离与加工委托

这个矩阵是本综述的分析工具,不是已验证的心理量表。任何格子都不能仅靠停留时间或消息数判定;多分支探索只有在损害任务目标或独立结果时,才能支持相应负面结论。

据此提出四项条件性假说:

  1. 配置假说:在相同任务与候选材料条件下,降低进入替代问题的操作成本,可能增加原问题未闭合时的无计划切换;持续供给可能放大或改变该效应。
  2. 加工假说:在设计上给予相同主目标、分支规则和资料范围时,完整结论先行相较尝试后纠错,可能减少用户自主生成与检验,并影响独立迁移。若减少的主要是无关负担,此预测不应成立。
  3. 适配假说:依据知识缺口的适配,相较通用或偏好/表达适配,可能更有利于目标相关加工。依据既有立场的过度肯定可能减少反证处理,作为独立拓展问题检验,不混入个性化主处理。
  4. 时机假说:即时回应的作用可能依反馈内容变化;用户的即时偏好可作为探索性异质性指标。速度与内容须分开操纵,测得的偏好不是已随机化的因果变量。配套方案A、B分别检验时机与内容的政策效应,尚不识别二者交互;该交互需要另行扩展因子设计及功效规划。

本项目的潜在学术增量,是在个性化对话中同时测量目标连续性与自主加工,分别识别交互设计对预定结局的总效应,并把环境可供性、反馈内容和适配依据分开。认知外包的利弊、学习支架及对话选择性接触已有研究,故不主张首次提出这些机制。

7. 证据缺口与研究方向

目前较强的证据集中于具体任务的即时产出或学习;长期、跨任务的注意变化仍缺乏与本假说直接对应的识别。生成系统、资料内容、呈现方式、用户主动性和教学策略经常一起改变,使“聊天”成为包含多种处理的标签。

后续研究应先在受控材料中拆分切换成本、供给方式与反馈时机,再检验个性化与答案方式,最后用生态追踪验证净结果。用户实际接触的论据、错误、字数和用时是重要过程记录,但通常属于处理后变量,不宜在主分析中任意控制而删去真实效应。

验证加工路径,应加入独立解释、反例辨识和延迟迁移;验证配置路径,应编码有计划支线、无计划换题与返回。若要进一步主张一般注意能力变化,需要主动对照、基线与重复注意测验、足够追踪,并考虑练习、睡眠和测量可靠性。短期结果也不能被称为不可逆损伤。

中文人群的语言、教育背景和对话习惯可能改变任务行为。正式研究须验证中文材料和编码规则,而非把英语任务、量表或用户结论直接迁移。配套研究计划与方法附录提供具体实验、评分与分析方案。

8. 结论

现有对话搜索及特定回应设计研究观察到查询与任务表现变化;个性化依据如何影响目标切换和自主加工,仍需分因素实验。某些 AI 干预可促进学习,另一些出现独立表现或论证方面的代价;其效果不能仅由对话形式、反馈速度或个性化程度决定。无计划切换与主题连续下的加工外包是不同机制,应分别测量。若适配围绕知识缺口,反馈回应用户的尝试,AI 也可能减少无关负担并支持持续推理。研究价值在于识别这些条件及权衡,而非预先断言人的注意必然缩短。

参考文献

以下29项为正文使用的作者—年份文献,含一项正式更正。具体访问、版本和证据边界见来源与检索台账。参考文献格式仍可按目标期刊要求调整。

  • Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), e2422633122. 原文/DOI
  • Castelo, N., Kushlev, K., Ward, A. F., Esterman, M., & Reiner, P. B. (2025). Blocking mobile internet on smartphones improves sustained attention, mental health, and subjective well-being. PNAS Nexus, 4, pgaf017. 原文/DOI
  • Cheng, M., Lee, C., Khadpe, P., Yu, S., Han, D., & Jurafsky, D. (2026). Sycophantic AI decreases prosocial intentions and promotes dependence. Science, 391, eaec8352. 原文/DOI
  • Chi, M. T. H., & Wylie, R. (2014). The ICAP framework: Linking cognitive engagement to active learning outcomes. Educational Psychologist, 49(4), 219–243. 原文/DOI
  • Chiossi, F., Haliburton, L., Ou, C., Butz, A., & Schmidt, A. (2023). Short-Form Videos Degrade Our Capacity to Retain Intentions: Effect of Context Switching On Prospective Memory. CHI ’23. 原文/DOI
  • Corral, D., Carpenter, S. K., & Clingan-Siverly, S. (2021). The effects of immediate versus delayed feedback on complex concept learning. Quarterly Journal of Experimental Psychology, 74(4), 786–799. 原文/DOI
  • Fan, Y., Tang, L., Le, H., Shen, K., Tan, S., Zhao, Y., Shen, Y., Li, X., & Gašević, D. (2025). Beware of metacognitive laziness: Effects of generative artificial intelligence on learning motivation, processes, and performance. British Journal of Educational Technology, 56, 489–530. 原文/DOI
  • Fisher, M., Goddu, M. K., & Keil, F. C. (2015). Searching for explanations: How the Internet inflates estimates of internal knowledge. Journal of Experimental Psychology: General, 144(3), 674–687. 原文/DOI
  • Graesser, A. C., Chipman, P., Haynes, B. C., & Olney, A. (2005). AutoTutor: An intelligent tutoring system with mixed-initiative dialogue. IEEE Transactions on Education, 48(4), 612–618. 原文/DOI
  • Han, X., Peng, H., & Liu, M. (2025). The impact of GenAI on learning outcomes: A systematic review and meta-analysis of experimental studies. Educational Research Review, 48, 100714. 原文/DOI
  • Kestin, G., Miller, K., Klales, A., Milbourne, T., & Ponti, G. (2025). AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15, 17458. 原文/DOI
  • Kim, N., & Ji, Y. G. (2026). Exploratory search with generative AI: An empirical study on the impact of interaction design strategies on information exploration and cognitive load. International Journal of Human-Computer Studies, 210, 103771. 原文/DOI
  • Kulik, J. A., & Kulik, C.-L. C. (1988). Timing of feedback and verbal learning. Review of Educational Research, 58(1), 79–97. 原文/DOI
  • Kurzban, R., Duckworth, A., Kable, J. W., & Myers, J. (2013). An opportunity cost model of subjective effort and task performance. Behavioral and Brain Sciences, 36, 661–679. 原文/DOI
  • Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., & Wilson, N. (2025). The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI ’25, Article 1121. 原文/DOI
  • Liu, X., Chin, J., Payne, B. R., Fu, W.-T., Morrow, D. G., & Stine-Morrow, E. A. L. (2016). Adult age differences in information foraging in an interactive reading environment. Psychology and Aging, 31(3), 211–223. 原文/DOI
  • Lorenz-Spreen, P., Mønsted, B. M., Hövel, P., & Lehmann, S. (2019). Accelerating dynamics of collective attention. Nature Communications, 10, 1759. 原文/DOI
  • Melumad, S., & Yun, J. H. (2025). Experimental evidence of the effects of large language models versus web search on depth of learning. PNAS Nexus, 4(10), pgaf316. 原文/DOI
  • Mittal, S., Blodgett, S. L., & Liao, Q. V. (2026). Learning by Chatting? Investigating the Impact of Generative AI on Information Seeking and Learning. arXiv, v2, 7 Aug 2026. 原文/DOI
  • Nakamura, D. (2026). Augmentation or Erosion? Regulating Cognitive Offloading in Generative AI-Supported STEM Learning. Educational Psychology Review, 38, 124. 原文/DOI
  • Risko, E. F., & Gilbert, S. J. (2016). Cognitive offloading. Trends in Cognitive Sciences, 20(9), 676–688. 原文/DOI
  • Salvi, F., Horta Ribeiro, M., Gallotti, R., & West, R. (2025). On the conversational persuasiveness of GPT-4. Nature Human Behaviour, 9, 1645–1653. 原文/DOI
  • Salvi, F., Horta Ribeiro, M., Gallotti, R., & West, R. (2026). Author Correction: On the conversational persuasiveness of GPT-4. Nature Human Behaviour. 原文/DOI
  • Sharma, N., Liao, Q. V., & Xiao, Z. (2024). Generative Echo Chamber? Effect of LLM-Powered Search Systems on Diverse Information Seeking. CHI ’24, Article 1033. 原文/DOI
  • Soderstrom, N. C., & Bjork, R. A. (2015). Learning versus performance: An integrative review. Perspectives on Psychological Science, 10(2), 176–199. 原文/DOI
  • Stadler, M., Bannert, M., & Sailer, M. (2024). Cognitive ease at a cost: LLMs reduce mental effort but compromise depth in student scientific inquiry. Computers in Human Behavior, 160, 108386. 原文/DOI
  • Tam, K. Y. Y., & Inzlicht, M. (2024). Fast-forward to boredom: How switching behavior on digital media makes people more bored. Journal of Experimental Psychology: General, 153, 2409–2426. 原文/DOI
  • Tankelevitch, L., Kewenig, V., Simkute, A., Scott, A. E., Sarkar, A., Sellen, A., & Rintel, S. (2024). The Metacognitive Demands and Opportunities of Generative AI. CHI ’24. 原文/DOI
  • Wiradhany, W., & Nieuwenstein, M. R. (2017). Cognitive control in media multitaskers: Two replication studies and a meta-analysis. Attention, Perception, & Psychophysics, 79, 2620–2641. 原文/DOI

个性化对话式内容获取、注意配置与独立认知表现:研究计划

版本:2026-10-07;状态:设计草案,尚未实施、尚未获得伦理批准、尚未预注册。本稿供研究团队评议、先导测试与正式方案制定。与文献综述、方法附录及来源与检索台账配套;方法来源的完整书目与访问边界在台账列示。

一、研究问题与位置

研究对象是以对话为中心的内容获取,尤其是可持续生成回应、低操作成本、快速反馈与个性化适配的交互环境。核心问题不是“用 AI 的人是否更不专心”,而是随机改变具体交互条件后,是否出现两条不同的路径:

  1. 无计划目标切换:原问题的推理尚未完成,用户转向与原任务目标无关或关联很弱的新问题。
  2. 主题连贯下的自主加工减少:用户仍留在原主题,但关键解释、证据整合、反例检验与纠错主要由 AI 完成;用户在撤去工具后独立表现可能较弱。

二者可共存,也可能方向相反。多轮对话本身不等于深度互动;使用 AI 节省工作记忆负担也可能释放资源用于更深入的比较。不同任务的适当标准不同:查一个事实的目标是及时准确,复杂争议或学习任务才适合用延迟迁移与独立论证评价。

既有证据已发现,对话搜索相较传统搜索可出现更有偏向的查询,强化用户观点的模型会加剧这一趋势;因此本项目不声称首次发现聊天可收窄探索。Sharma、Liao 与 Xiao,2024 本项目的增量是:A 检验环境操作对无计划切换的总效应;B 检验回答策略与两种适配目标对独立迁移的总效应;C 检验默认工作流经数周使用后的表现,并以过程指标检查两条机制是否相符。这些试验的随机化不自动识别切换或自主加工的中介效应。答案式 AI、提示式 AI 以及搜索条件下学习差异的既有研究给出相反方向的可能性,不能预设总体净效果。Bastani 等,2025;Kestin 等,2025;Melumad 与 Yun,2025。Bastani 的普通 AI 与提示式导师同时涉及提示策略及教师提供的正确解/常见错误,不能单归因于交互形式;Melumad 的受控实验比较的是综合答案与多网页的呈现包,也不是对话轮次的纯效应。这正是本项目锁定正确答案、反证和事实来源并分别操纵交互条件的理由。

简化因果结构:随机指派的界面/回应策略 → 实际接触与用户行为 → 目标切换、自主解释与检验 → 即时及延迟的独立表现。基线知识、阅读能力、原有观点、AI 熟悉程度和任务兴趣会影响行为与表现,须在随机化前测量。后处理的接触量、轮数和主观满意度不是可以随意加入主模型的“控制变量”;它们可受处理影响,简单调整会改变所估计的因果量。

二、待检验假设与因果量

以下假设均针对指定人群、任务和干预版本。记 Y(z) 为同一受试者若被指派条件 z 时会有的结局;主要估计指派策略的平均效应(treatment-policy / intention-to-treat, ITT),不是只分析实际高频使用者的效应。后者因使用选择而容易失去随机化保障。

假设 处理对比与方向 预定主要/次要检验 因果量与不应声称之事
H1,主要环境假设 换题一键进入 vs 换题需完成若干中性操作;在同一供给条件内可访问同样的分支集合。低成本条件预计提高“原目标未完成时至少一次无计划离题”的概率。 研究 A 的唯一主要检验;结局须盲编码。 2×2×2 随机设计中,对其他随机因素作设计分布平均的风险差 E[Y(C=低)]−E[Y(C=高)]。它是界面切换摩擦这一操作包的效应,不能分拆为单纯手指点击或操作时的反思。
H1a,供给次要假设 固定有限的系统主动建议库存 vs 每轮回答后追加新建议;两组均可自由提问并继续得到生成式回答。主动分支供给可能增加无计划离题。 研究 A 的第 1 个有序次要检验。 对主动建议流策略的 ITT;建议曝光数是处理诱发的中间量,不能推为所有持续生成供给的效应。
H1b,时间次要假设 同一已生成回答在生成完毕后再等 3 秒 vs 30 秒展示;不改变回答的知识内容。方向预先保留双侧。 研究 A 的第 2 个有序次要检验;重点查看目标切换、自行尝试及接受度。 是额外展示延迟的策略效应,可能同时改变可完成的轮数;不等同于用户“偏好即时反馈”或神经奖赏机制。基线即时偏好另行测量。
H2,加工替代 在同样可提问的对话界面中,完整答案先行 vs 用户先作出解释/判断再得即时定向纠错。后者预计提高一周后无 AI 独立迁移表现。 研究 B 主要检验。 回应策略的 ITT。自我解释的变化是机制证据,不能仅凭自然中介回归声称已经识别中介效应。
H3,适配目标 按随机化前测得的表达形式偏好安排呈现 vs 根据知识缺口安排例子与追问;另有通用固定呈现作为基线。知识缺口适配相对偏好适配预计提高一周后独立迁移。 研究 B 与 H2 并列主要检验;通用组的其他对比和交互为次要。 两种个性化政策的 ITT 对比;不包含按既有立场表示赞同或回避反证。迎合性既非该处理定义,也非个性化的必要成分。
H4,生态持续性 数周真实任务中提供“先尝试、再纠错”的 AI 工作流 vs 提供完整答案先行的 AI 工作流。前者预计提高撤去工具时的任务特定独立迁移。 研究 C 的主要检验;一般持续注意任务仅探索。 “被提供某种工作流”的群体平均效应,不等于实际使用剂量效应,也不等于永久改变通用注意能力。

研究 B 中答案方式×适配策略的交互应事先报告估计值与区间,但除非样本量模拟证明有足够功效,不作确认性主结论。一个独立于上述适配的补充研究可操纵“承认事实并呈现反证”与“无条件肯定用户观点”,研究选择性查询和信心校准;若没有资源,应把迎合留作观察性编码与未来实验,绝不把它混入 H3 的知识缺口适配处理。

三、研究 0:材料、量表与可行性先导

目标。 建立两类中文任务材料,并锁定正式实验所需的处理版本、评分手册和功效输入。复杂学习任务可用生活科学、公共政策或跨学科争议,避免专业知识门槛过高;每个题目有明确主目标、3–5 个必要子目标、可核验的事实卡、至少两种合理解释和反证。另设单纯事实查找题作边界条件,检验任务目标不同是否改变评价。涉及争议的议题避免高度敏感的个人经历、法律或医疗决策。

材料控制。 研究团队预先建立封闭、带来源的事实库和正确性检查表;冻结模型版本、系统提示、检索范围、温度和建议生成规则。每个条件能接触到相同的核心事实;界面因素只改变进入路径、建议何时追加或回答何时出现。生成式多轮对话不可能保证实际看到的句子和事实完全相同,因此要保存模型原始输出、随机种子/版本、每轮事实点、字数、来源、延迟、用户请求与所见界面。用与分组无关的专家盲评事实正确性、可读性、与原任务相关性和迎合语气;若严重失衡,在正式随机化前修订材料。正式实验之后不能因不利结果改写提示。

认知访谈和编码先导。 招募约 40–80 名与目标样本相近的中文受试者(最终数量由饱和度和编码稳定性确定)。通过访谈核查“无计划换题”“独立解释”“反证”在中文对话中的可观察边界。参加者在对话前用一句话写下主目标、可观察的完成标准及计划子问题;任务中可有理由地修订目标,但须在日志标注。先导后冻结编码本:按语义动作而非整条消息编码(同一消息中的两个问题可拆开),G 为推进原目标,B 为有工具作用的支线,U 为无可说明关联的新目标,R 为返回主目标,M 为纯操作/寒暄,无法判断时留 ?。自主加工另编码 0=请求/照搬结论、1=复述/摘取、2=提出新解释或有根据的比较、3=提出反例、核查证据或修正;这一等级是本项目拟定的观察规则,不是 ICAP 的原量表,也不宣称读出了内在思维。多轮谈话需要保留前文语境供编码,但遮蔽界面元数据;若用语本身泄露分组,记录盲法失败率。正式样本至少分层抽取 20% 由两名编码员独立评分,报告逐类混淆和机会校正一致性,争议按预设仲裁流程处理;先导中则对更多样本双编码以修订手册。自动编码只作辅助,须先与人工金标准核验。

入口检查器先导。 在正式随机化前锁定可接受的错分率、误触发后的纠正率及绕过率门槛,并报告区间与题目差异。达不到门槛则修改入口并重新先导,不能靠正式样本事后筛除弥补。所有组的目标标签提示也可能使用户反思目标,改变自发切换;研究 A 须同时报告用户自选标签与盲编码标签的差异。若错分与组别或题目强烈相关,对结果的解释收窄为该具体界面策略的效应。

量表。 简体中文自报负荷可以参考已有中文版 NASA-TLX 的信效度研究,但医生样本上的验证不能自动推广到本研究学生/一般成人;先导需检查语义理解、分量表结构和是否有地板效应。马琳琳、潘志刚,2018 “目标切换”“认知委托”“即时答案偏好”优先作为预定义行为与单题项目,而非临时拼成未验证心理量表。对外文题项执行双人翻译、回译/专家审阅、认知访谈;若比较不同人群或时间,检验测量不变性。注意探针需区分任务相关思考、对任务表现的忧虑和真正任务外走神,因为题项选择会改变报告比例。Kane 等,2021 探针本身可能影响对话,实验主流程不宜密集插入;在专门随机子样本估计本任务中的反应性。Welhaf 等,2023 是对既有数据的探针数量二次分析,支持谨慎选择数量,并未直接随机验证本对话任务中的探针反应性。

四、研究 A:环境因素的随机识别

设计与样本。 单次在线受控实验,成人中文读写者,按基线知识与题目区组随机,三项二水平因素形成 2×2×2 的八个条件。每人只做一个主要学习任务,限时约 35–45 分钟;各条件界面说明、答复正确性标准和可用基本资料相同。预试前的情境规划为招募 N=512、每格 64 人:若高成本组的主事件概率为 .30、低成本组为 .45,双侧 α=.05、目标功效 90%,粗略计算需约 440 名可分析者;10% 损失时需约 496 名招募者,512 留少量余量。若真实差异只有 .10,约需 960 名可分析者,当前规划就不足以稳健排除这一较小效应。最终样本量在先导后结合事件率、最小重要差异和模拟功效冻结;不能把这些假设当成已知效应。若预算不足,先把速度因素放入独立随机子实验,避免八格中每格过小;报告哪些交互因而未被识别。

独立操纵。 C 只改变进入新目标的操作步骤:两组均在提交时选“继续原目标/开启新目标”,低成本一键进入;高成本在相同选择之后增加数个中性确认操作,不加等待,避免与 T 的时间延迟混在一起,也不设置“请反思”等教育性提示;两组都可回到主任务。自由输入仍被允许,用户若把新目标标成“继续”,则记录为绕过操作而不按遵从与否删样;同一冻结的意图检查器在所有组提示明显的误标并容许用户纠正,先导评估误判率。S 固定库存组开始可见数量有限的系统主动候选分支,用尽后仍可自己提出任意问题;持续建议组每轮再追加候选分支。所有组均可自由提问并继续得到生成式回答,所以 S 仅识别主动刷新建议流的效果,不识别“AI 能否持续回答”的效果。起始候选和可访问的核心事实相同;新建议要记录是否被展示、点开、忽略,并按是否服务原目标编码。T 对每条已生成的回答,在模型生成完成后再等待 3 秒 vs 30 秒展示;预试可检查可实施性,但若更改秒数须在正式招募前冻结。额外展示延迟固定为 27 秒,查询至生成完成的模型耗时仍可能变化,需逐条记录;等待期间不能偷偷换用另一模型或改变内容。两个条件在相同总任务时间内自然可能有不同轮数,这是时间策略效应的一部分,必须报告。C、S、T 的交互可能存在,但八格规划未以交互为确认性目标,需预先报告估计与不确定性。

流程。 入组时测基线知识、原议题兴趣、AI 使用经验、阅读速度、即时反馈偏好;受试者先写主目标、完成标准与计划子问题,然后分配条件,完成一段练习,再进入主任务。实验后在无 AI 条件下先作短的独立解释与反例题,再回答主观负荷、满意度与自己感觉是否完成。偏好即时反馈用预先设计的选择题/情境取舍来记录,而非由“用了很久”倒推。另可在一周后做独立迁移,作为探索性结果。

主要结局。 Y_A=1 若在原目标与必要子目标尚未达最低完成标准时出现至少一次经盲编码确认的 U 类无计划新目标切换,以第一次事件确定;否则 0。不要求切换后再发生若干动作,避免 T 因改变对话轮数而使各组有不同的“被计入机会”。每个人的目标完成状态由事前任务评分表决定。预设敏感性分析包括更严格的“随后两个语义动作仍未回到主目标”定义;会话结束时不足两个动作的事件要单列为右删失/无法判定,不能自动当作未持续。还报告每固定 20 分钟事件数、首次转移时间、返回率、目标完成率与独立解释质量。用固定时间作事件率分母,避免因处理改变消息数而制造比例差异。真正任务外思维探针(如采用)、提示数、建议曝光和实际等待时间作为次要/过程指标。消息数不是主要结局:有目的的反例追问属于持续推理。

解释限制。 C 的效应可识别为操作摩擦包的效应;S 的效应可识别为“主动刷新候选建议”的策略效应;T 的效应可识别为“生成完成后的额外展示延迟”的策略效应。不能从三个主效应推断“低切换成本、持续供给、即时反馈在现代社会形成了历史性的注意能力下降”,也不能把“更偏好快答”从随机时机效应中直接推出。实际接触量可解释机制但受到处理及用户选择共同决定,主分析不据此筛人或调整。

五、研究 B:个性化与回应方式的随机识别

设计。 在新受试者中采用推荐的 2×3 组间随机:A 完整答案先行 / 用户先尝试再得即时纠错;P0 不据个人资料变化的通用固定呈现、P1 根据随机化前测得的表达形式偏好适配、P2 根据随机化前测得的知识缺口适配。六组使用同一封闭事实库、界面、回应速度、来源标准、可提问次数上限和总时间。研究对象优先使用确实要求因果解释、证据整合及迁移的任务。先导确定难度,避免天花板与低能力者完全无法尝试。预试前的情境规划为 N=990、六格每格 165 人;假定第 7 天失访 15%,可完成约 842 人。若 H3 的目标对比 P2−P1 最小有意义标准化差为 .30、90% 功效、双侧 α=.025,粗略正态近似需两种适配策略各约 276 名完成者,相当于六格共约 828 名完成者、约 978 名招募者;990 留少量余量。H2 在三种 P 水平上平均,样本较充足;若预期 A×(P2−P1) 交互差仅为 .40 个标准差,当前 N 不足以将其列为确认性目标。上述 p 值门槛、失访和效应量是规划输入,不是结果;正式 N 待先导和模型模拟冻结。Lakens 与 Caldwell,2021 资源不足时可降为 2×2 最低方案(P0 对 P2),但那只能估计“有无知识缺口适配”,不能比较两种个性化目标,也无法充分回答用户重视的个性化问题;需在研究目标中明说这个边界。

处理内容。 每位受试者在随机化前完成不反馈的知识诊断,并选择喜欢的解释顺序或形式(例如先规则后案例 vs 先案例后规则;避免把“我喜欢别人认同我”作为偏好题)。P0 用固定通用顺序;P1 根据事前偏好改变解释顺序/呈现方式;P2 根据诊断中的错误决定优先例子与追问,保持中性表达。三种策略的关键事实、反证和最终正确解释均应可获得;P1 与 P2 对比是不同适配目标所形成的政策对比,不声称分离“适配目标”之外的一切内容差异。所有 AI 回应采用相同的中性尊重语气;遇到错误必须指出事实与反证,不因用户既有立场提供额外肯定。用“呈现是否符合事前偏好”和“追问是否命中诊断缺口”分别做操纵检查,并以独立标注核查事实准确性与迎合。若模型偶发迎合,保留在 ITT 样本中并报告污染比例,不能事后删去这些对话。

答案先行组在用户发问时给出完整论点与理由;尝试后纠错组先要求用户作出可记录的解释或判断,再针对其所写内容给出证据与纠错。两个方案都即时回应用户已输入的内容,因而本研究 不识别响应速度效应(由研究 A 的 T 因素研究)。不同策略自然改变用户努力与轮数;因此这是可部署工作流的总体效果,不是单个“纠错句子”的净效应。自我解释与延迟测验的依据来自学习研究,但这些研究本身不证明 AI 条件中必有同样效果。Chi 等,1994;Roediger 与 Karpicke,2006。

流程与结局。 第 0 天基线诊断和表达形式偏好测量 → 随机分配 → 30–45 分钟同一任务对话 → 立即无 AI 独立测验 → 第 7 天无 AI 新例题迁移。第 7 天的独立迁移分数为主要结局,拟锁定为 0–20 分:事实准确性、因果解释、证据整合、对题中给定反例的处理各 0–5 分,依据事实点和推理点给分,流畅但错误的长文不得高分;另设未提示反例的开放题,探索用户是否自发提出反例,不能与主评分中的被提示能力混称。正式评分手册须给每维 0/中/满分锚例、错误事实扣分规则、题间等值性与双人一致性,并在先导冻结。评卷者只看匿名答卷。H2 是在 P0/P1/P2 按随机分配比例平均后的答案策略效应;H3 是在两种答案策略上平均的 P2−P1 对比;两项为预先指定的主要对比,P0 与其他组对比及交互为次要。即时测验、人机协同产出、用户独立贡献、目标连续性、主观理解感、信心—正确率校准(每题附 0–100% 信心)、对反证材料的查询和实际阅读比例为次要结果。若争议任务的观点测量仅反映立场变化,不应混同“理解更好”。

失访。 第 7 天的未返回者不得直接按零分处理,也不能仅在完成随访的人中宣称 ITT。尽量降低失访(固定报酬、提醒与短测验),报告六组失访和基线预测因素;主要分析按预定可观测资料模型,随后做多重插补和偏离随机失访的敏感性区间。若失访差异大或结果对合理假设敏感,结论降级。

六、研究 C:数周生态验证及“状态—能力”区分

样本与随机。 招募有真实学习/信息研究需求的成年中文使用者;在随机化前确定其主要任务领域和研究提供的统一锚任务,按基线知识、既往 AI 使用、任务领域及职业/年级分层后,将每人随机指派持续约 8 周使用一种研究工具的默认工作流:完整答案先行或先尝试再纠错。两组都允许基于诊断的知识缺口适配,并保持同样的切换界面、建议供给和即时反馈时机,以尽量聚焦 H2 的工作流策略。本阶段不单独识别知识缺口适配的长期效应;若资源足够,可扩展为与研究 B 相同的六组因子设计,但须重做功效、伦理和主检验计划。可以增加传统网页检索组作实践参照,但该对比同时改变搜索、界面与内容形式,不能解释为 AI 的单一机制。预试前的情境规划为招募 N=480、每组 240;若第 12 周失访 25%,约 360 人可评分。假定最小有意义标准化差 d=.35、90% 功效、双侧 α=.05,粗略正态近似约需 344 名完成者,含 25% 损失约需招募 460 人;480 留少量余量。最终 N 仍以先导失访、题目间差异及模拟确定。若只有数周数据,措辞为“较长期真实使用”,不可称终身能力变化。

真实任务与记录。 参加者随机化前从预定的低风险学习/信息领域中选择一个领域并接受该领域的共同锚任务,再记录 1–2 个本人实际需要的持续任务;主分析使用共同锚任务的无辅助迁移分数,个人真实任务作为生态次要结果。每周记录研究工具中的完整会话、建议展示/点开、实际回复时延、任务继续/放弃、引用的来源与用户自己提出的解释。设置每周极简任务日记和少量随机时点自报,记录研究工具外使用其他 AI/搜索/课程/笔记及原因。无法禁止且不应隐瞒工具外使用;这既是污染也是现实环境的一部分。主估计仍为被提供默认工作流的策略效应。实际使用小时数、每次会话轮数和第三方工具使用做描述及事先规定的探索性分析,不用“只保留遵从者”替代随机对比。数字干预报告至少需给出版本、使用和失访流程;可参考 CONSORT-EHEALTH。

测量时间点。 基线、每两周简测、第 8 周、撤去研究工具后的第 12 周分别完成共同锚任务的无 AI、等值平行题独立迁移测验。主结局预定为第 12 周按预先锁定领域评分规则形成的标准化共同锚分数,并调整同尺度基线分数;第 8 周为关键次要结果。每个领域先导需验证锚题和难度等值,避免因领域差异让一个合并分数失去解释。基线和第 8/12 周另做独立的标准化持续注意任务,例如 gradCPT 的平行版本,并记录反应时变异和疏漏/误按;测试在相近时段、设备及疲劳条件下进行。gradCPT 是注意持续表现的一个操作化,不等同于“一般注意能力”的全面指数;原始任务见Rosenberg 等,2013。如有任务中即时走神探针,间隔和数量先导固定,不能把被探针打断的表现与未探针会话直接比较。

三种结论层级。 (1) 若会话内更常走神或提前换题,仅表明情境状态/行为变化;(2) 若第 12 周无 AI 迁移有差异,表明该任务类的独立学习结果变化;(3) 若持续注意测试随时间有稳健的组间差异,才能谨慎讨论跨任务持续注意表现变化,还必须排除练习、疲劳与失访影响。即使 (3) 成立,8 周干预与第 12 周追踪也不足以证明永久的普遍注意能力改变。还应报告共有人机完成效率,避免将“独立成绩好”误判为所有任务中的唯一社会价值。

七、随机化、盲法、统计和多重比较

随机序列由独立人员生成并在系统内隐藏;按任务题目、基线知识和必要人口变量分层/区组。参与者显然能看出自己看到的界面或回应方式,无法盲于处理;研究人员也可能知道产品配置。保持终点评分员、匿名会话编码员和在分组标签解盲前运行锁定分析脚本的分析员盲于指派。日志措辞可能泄露分组,须记录猜测分组率及其原因,不能虚称完全双盲。

研究 A 的确认性序列:先在双侧 α=.05 检验 H1;若通过,依次检验 H1a、H1b(固定顺序 gatekeeping),若前项未过则后续仅给区间与探索性解释。研究 B 的 H2、H3 两个主效应用 Holm 方法控制家族错误率;交互、子组与其余结局报告效应量、95% 区间,并标记探索性。研究 C 只有一个主对比、一个第 12 周主结局;额外组若加入须重写多重比较计划。跨研究不把重复显著性当作一项未预定的总体元分析;若最终要合并,预先定义可比任务和效应量。

研究 A 的主模型可用带区组因素的二项回归,报告边际风险差与风险比及区间,同时描述八格事件风险;同一受试者多次任务机会的敏感性分析用受试者/题目随机截距。T×基线即时偏好 是预先说明的探索性异质性估计,偏好本身并未被随机操纵,不可解释为性格特征的因果效应。研究 B 的连续迁移分数按基线分数和题目调整,用答案方式、三水平适配及其交互的线性模型/分层模型;盲评员评分可在模型中处理。报告六格均值与 H2、H3 边际对比,若交互方向或大小有实质意义,同时报告相应简单效应。不得仅保留主题连贯者分析 H2:主题连贯性可能受答案策略影响,主结论为策略总效应;主题连续变化另作过程结果。研究 C 用纵向混合模型估计组别×时间,同时预先给出第 12 周主对比;必要时按受试者与题目聚类。效应区间优先于仅报告 p 值。主模型不得将轮数、实际曝光、满意度、思考时长等随机化之后的变量当普通混杂因素调整;它们用于机制描述与单独预先说明的探索性分析。对“中介导致结果”的说法必须披露额外的可交换性假设和敏感性分析,或以后采用序贯随机设计进一步识别。Imai、Keele 与 Tingley,2010

功效规划。 先导估计事件率、评分标准差、题目间相关与第 7/12 周失访率;在正式入组前写明最小有学术/教育意义的风险差与分数差,模拟在现有材料、随机分层、失访 10%/20%/30%、模型参数不确定性下的功效。交互与注意能力结果分别模拟,不借主要效应样本量“顺带”声明足以检出交互。建议用公开的模拟脚本与输入表留档;Lakens 与 Caldwell,2021说明因子设计功效需针对实际目标效应。另需区分最小重要效应、预期效应与当前资源下可检出效应,不可将可检出值倒写成重要效应。Lakens,2022 若可用样本不足以识别最小重要差异,应减小确认性问题数量或如实定位为估计性先导研究,而非事后改变阈值。

缺失与遵从。 记录随机化后从未启动、提前退出、技术故障、随访缺失、使用外部 AI 的比例与时间;以指派组为分母画流程。单次实验技术故障若使指定处理完全未呈现,按预先规则标记并保留 ITT 与敏感性分析。失访主分析明确何种缺失假设;以多重插补、逆概率加权或区间/偏移分析检验结论对非随机失访的敏感性。若研究工具外的 AI 使用在两组差异较大,报告为干预后的现实行为,不在主模型中机械“控制掉”。上述策略在预注册前由统计人员敲定。CONSORT 2025和 SPIRIT 2025可作方案和报告清单;估计目标的定义可借鉴 ICH E9(R1),但本项目不是临床试验。

八、可证伪条件、替代解释与解释边界

若低切换成本不增加无计划离题,且风险差区间排除了预设最小有意义增加,H1 在本任务及处理版本下被反驳;统计不显著但区间很宽只表示证据不足。若持续供给使用户更多阅读反例、完成目标更好,单向“持续供给促碎片化”的解释被削弱。若延迟回答提高独立解释,但同时显著降低可得内容,不能声称纯粹的“偏好反馈”机制;反之即时反馈也可能支持尝试后纠错。

若答案先行降低用户自己写出的解释,但第 7/12 周独立迁移不下降,单纯“加工量减少必然损害学习”的说法被反驳;可能是高效委托。若先尝试增加字数而不提高反例处理与迁移,也不能把多写内容等同于深加工。若知识缺口适配只提高主观理解感而无客观收益,应报告“理解感—表现脱节”。若迎合性污染在适配组更高,H3 的解释受到破坏,需要报告这种处理不忠实而非把它称为个性化的必要作用。

另一种重要可能:对话使问题更多,但新问题是为了完成同一目标,独立迁移反而提高。这将反驳按消息数、换屏数界定“碎片化”的简单模型。若生态试验仅会话内状态不同、标准化注意测试无稳健差异,应止于情境性结果,不主张能力变化。能否从一个中文成年样本推广到儿童、不同文化、专业工作及未来模型,仍需复制研究。

九、伦理、治理与公开实践

正式招募前须提交相应伦理审查;目前没有获批。知情同意明确记录完整对话、任务外 AI 使用的自报、随机化、随访与退出方式。对话可能含个人敏感信息:研究系统尽量阻止输入真实姓名、病史、账号和第三方隐私;传输与存储加密,去标识化并限定研究成员访问,预设保留与删除期限。将日志提交第三方模型服务前需核查数据处理条款,能用机构可控端点则优先。发表可共享匿名的任务材料、提示模板、评分规范、分析代码及充分脱敏的统计数据;原始对话不默认公开,因自由文本再识别风险高。

不以降低学习机会为长期目的:受试者可退出,随访结束后向各组提供同等正确材料和补充解释。涉及观点任务时选低风险议题,避免向受试者故意灌输明显错误事实;若独立研究迎合性,用准确而不同语气的回答、预设上限与事后说明。应对模型虚构来源做自动校验和人工抽检,并事先定义严重错误触发暂停的规则。补偿按时间给付,不按观点或答题正误给付。

十、执行顺序、资源与决策门槛

阶段 时间估计 人员与主要资源 前进门槛
文献更新、任务库、伦理与先导 2–3 个月 认知/学习研究者、HCI 研究者、中文题目专家、工程师、统计师;规划先导约 60 人 事实准确、处理操纵可见、编码一致性与随访流程可接受;锁定评分手册
研究 A 2–3 个月 在线招募平台/实验室、受控对话系统、日志系统、双人编码;情境规划招募 512 人(8 格×64) 主要目标切换指标可评分;检查材料平衡,不依据结果更改主假设
研究 B 2–3 个月(含第 7 天随访) 同类平台、题库平行版本、盲评员;情境规划招募 990 人(6 格×165) 两种适配操纵和无迎合检验合格;独立迁移评分可靠;报告失访
研究 C 4–6 个月(含第 12 周测量) 8 周稳定工具、支持人员、使用日志与随访;情境规划招募 480 人(两组×240) 足够实际接触、数据完整性及伦理运行;无法达到门槛则定位为可行性试验
分析、复制与稿件 2–3 个月 统计师、独立评分员、开放材料整理 按锁定分析计划报告阳性与阴性结果、版本与偏差

总历时可按阶段门槛约 12–18 个月,若研究 C 并行准备可缩短;按 60 人先导及 A/B/C 上述情境规划,总招募数 60+512+990+480=2,042 人,可选 B2 另算。这个数是预试前、基于假设效应量与失访率的资源规划,不是正式样本量承诺。研究预算除受试者报酬外包括模型调用、平台开发与托管、专家事实审核、双人标注、随访运营、数据安全审查与题库授权。若资金有限,应优先完成研究 0、A 的主要环境对比与 B 的独立迁移;C 需单独资源支持,不能把一次实验称为长期验证。

十一、新补检的方法与直接相关来源及访问边界

检索日期 2026-10-07。采用题名、DOI 和机构/期刊网页定向查找,优先原始论文与官方指南;没有声称穷尽数据库。除已有证据台账 R01–R27 外,新增如下:

文献 对本计划的实际用途 访问与限制
Sharma, Liao & Xiao (2024), CHI,DOI 10.1145/3613904.3642459 两项对话搜索实验发现更偏向自身观点的查询,强化观点的 LLM 加重偏差;用于选择性查询指标和新意定位。 核对作者机构摘要及作者稿;本文不引用未核对的效应量。
Chi 等 (1994), Cognitive Science 自我解释促进理解的原始实验,为“先尝试”设立机制动机。 期刊原摘要和作者机构 PDF;原研究是少量八年级学生,不能直接外推 AI 成人样本。
Roediger & Karpicke (2006), Psychological Science 延迟无辅助测验的重要性;即时流畅感可能与延迟保持不一致。 原期刊摘要;检索效应方向,不直接借用效应量作 AI 试验功效。
Welhaf 等 (2023), Behavior Research Methods;Kane 等 (2021), Behavior Research Methods 走神探针数量和题项构念的测量边界;反应性由本项目随机子样本检验。 Welhaf 为既有数据二次分析,不是探针反应性的随机试验;Kane 论文已有正式更正,此处不引未核验的更正细节。
Rosenberg、Noonan、DeGutis & Esterman (2013), Attention, Perception, & Psychophysics gradCPT 原始任务方法;2014 年 Esterman 等的研究是后续应用。 PubMed 原摘要及作者机构原文;中文成人样本中的测试稳定性和平行版本须本研究检查。
Lakens & Caldwell (2021), Advances in Methods and Practices in Psychological Science 因子设计的模拟功效,尤其避免用主效应样本量声称交互功效。 期刊原摘要、机构 PDF 索引;具体 N 尚待本项目先导参数模拟。
Lakens (2022), Collabra: Psychology 区分最小重要效应、预期效应与资源可检出效应。 期刊原文可访问;本文给出的 N 仍为待预试校核的情境规划。
Imai、Keele & Tingley (2010), Psychological Methods 随机化总效应与自然中介效应的识别条件及敏感性分析。 DOI/机构存档核对;本文未计算中介因果效应。
Eysenbach (2011), CONSORT-EHEALTH;CONSORT 2025;SPIRIT 2025;ICH E9(R1) 预先定义结局、分析、失访/使用数据和估计目标;作为方法检查表。 官方期刊/指南页面;E9(R1) 原为临床试验框架,在此仅借其估计目标思路。
马琳琳、潘志刚 (2018),中文版 NASA-TLX 信效度研究 中文负荷条目适配起点。 中国全科医学 21(33):4127–4133,临床医生样本;不提供本项目目标人群的现成效度保证。

正式方案前尚需逐项核验:可用题库版权与事实源、模型服务的数据处理条款、持续注意测验的中文实施细节和重测信度、先导编码一致性、实际响应延迟分布、效应量/失访假设下的功效、伦理审查要求与可承担预算。上述项目都是待完成工作,本稿没有将其写成已通过的批准或验证。

十二、可选的独立研究 B2:立场迎合的效应

研究 B 的 P0/P1/P2 均要求相同的事实正确性和中性尊重语气,并没有随机操纵迎合性。若要检验“根据用户立场给予过度肯定”的因果命题,可独立开展 B2,避免将其误写成 H3 已检验的结果。

设计与处理。 随机化前测量受试者对低风险、可争论议题的原有立场及确信度;两组在同一对话任务中接触完全相同的事实点、来源及一条针对其立场的反证。随机指派一组得到“过度肯定原有立场”的语言表达,另一组得到“承认其合理部分、同时校准不确定性”的语言表达。两组都须准确呈现反证,不捏造支持证据或回避关键信息;先导用独立盲评确认事实、反证可见性、字数和可读性近似,同时确证感知到的肯定强度确有差异。此处理估计的是在事实与反证相同的条件下,立场肯定表达策略的 ITT 效应;因为两个回应都针对基线立场,不能解释为“个性化有无”的效应。

主要结果与分析。 第 7 天不使用 AI 时,受试者处理同一强度但新形式反例的得分为唯一主要结果,按可核验的反证识别、证据权衡,以及有根据地维持、缩窄或修订判断预先评分;不以观点改变本身或最终立场方向加分;信心—正确率校准、选择性查询、再使用意愿及同题停留为次要结果。以随机化分组为主比较,按基线立场强度和知识水平调整;所有后处理的满意度和对话轮数只做机制描述。若过度肯定增加使用意愿而无辅助反例处理不下降,不能宣称认知损害。伦理上应先选低风险议题、确保正确反证对两组都充分可见,并在随访后解释研究目的。

资源边界。 预试前可用标准化最小重要差 d=.30、双侧 α=.05、90% 功效及第 7 天失访 15% 作独立情境:粗略正态近似需约 468 名完成者,故招募约 560 人。最后人数仍待该任务的先导方差、失访与评分一致性校核;B2 不计入 A/B/C 的 2,042 人规划。B2 尚未实施、尚未获伦理批准,也没有预注册。

方法附录:操作化、评分与样本量规划

版本:2026-10-07。配套文献综述、研究计划及来源与检索台账。这是拟议研究的方法规格与预试前规划,未采集参与者数据;数字不是实测效应或已获经费的样本量承诺。

1. 研究主张、估计目标与指标对应

研究 确认性主要对比 主要结果 不由此识别的结论
A,八组 低/高分支入口操作成本,在两项其他随机因素上平均 固定任务期间至少一次无计划目标切换的风险差 操作次数的纯认知效应、偏好的因果作用、长期注意能力
B,六组 H2:尝试后纠错/完整答案,在三类适配上平均;H3:知识缺口/偏好表达适配,在两种回应方式上平均 第7天无AI的0–20分独立迁移 两个中介的自然因果效应、所有个性化的总体效应
C,两组 被提供两种默认工作流的策略差异 第12周共同锚定任务的无AI迁移 使用剂量的因果效应、永久或完整一般认知能力变化
B2,独立可选 过度肯定/校准表达,事实与反证内容匹配 第7天无AI反例处理 偏好个性化本身的效应、临床依赖

A 的持续供给因素专指系统主动刷新候选分支,所有条件仍可自由提问并获得回应;它不单独检验全部“按需持续生成”的存在。反馈时机处理识别呈现策略,其曝光和等待机会的变化属于总效应。不能用控制处理后曝光量的回归制造“纯速度效应”。

主效应按随机指派估计,实际接受到的内容与用户行为另行记录。若个性化或回应方式改变了目标连续性,B仍报告总效应,不能只保留主题连贯者作为主要分析。

2. 功效计算方法与已复算结果

采用大样本正态近似;假定参与者独立、平衡分配、连续成绩组间同方差,不借用基线调整或重复测验可能带来的增益,不含学校/班级聚类设计效应。二元结果近似只针对主要边际风险差;正式方案需使用先导参数模拟实际二项/混合模型。

所有最小重要差异和失访率均为规划输入。研究者须在正式随机化前根据任务含义、预试和可承担精度锁定,不能观察正式组间效应后修改。流失膨胀只用于招募预算,绝非排除未完成者的分析规则。

2.1 公式

两组连续分数对比,每一边所需完整样本近似为:

n = 2 × (z(1−α/2) + z(power))² / d²。

B的H2为两种回应方式对比;H3只比较P2和P1两类适配,P0仍需招募,因此H3规划下六组总完整N约为3n。各P类别中两种回应方式均分。

二元结果p0与p1、每一边人数近似为:

n = [z(1−α/2)√(2p̄(1−p̄)) + z(power)√(p0(1−p0)+p1(1−p1))]² / (p1−p0)²,其中p̄=(p0+p1)/2。

一个2×2子设计的差中之差若按共同SD标准化为δ,每格人数近似为:

n_cell = 4 × (z(1−α/2)+z(power))² / δ²。

B有六格;若检验P2/P1与回应方式的交互,四个相关格子需达到此人数,保留P0两格并均衡招募时,总完整N约为6n_cell。

2.2 A:切换风险差敏感性

假定高成本组发生至少一次无计划切换的概率p0=.30,双侧α=.05,功效90%;低成本效应是下表输入,并非已知事实。

输入p1 风险差 平衡八格最低完整N 10%缺失的最低招募规划
.35 5个百分点 3,688 4,104
.40 10个百分点 960 1,072
.45 15个百分点 440 496

主体规划招募512人,每格64。它以15个百分点为所关注差异的情境,有少量余量;不足以确认排除5或10个百分点的效应。供给、速度及交互的功效须另算,不能自动继承主成本比较的功效。

2.3 B:适配主要对比敏感性

双侧α=.025用于两项主检验Holm程序的保守最严格阈值,功效90%,H3为知识缺口适配P2对偏好/表达适配P1。P0是通用参照;六格均衡分配。

输入标准化差d 每个P类别完整n 六格最低完整N 15%失访的最低招募规划
.20 621 1,866 2,196
.30 276 828 978
.40 156 468 552

主体规划招募990人,每格165;按15%失访,预计约842人有第7天数据,但失访可能不均衡。H2的边际回应方式对比在同样d输入下人数更充足;H3决定这组情境的招募规划。缺失处理仍按计划保留随机指派,不把“预计完整人数”当成完成者分析的许可。

2.4 B:交互不能顺带宣称有功效

双侧α=.05、80%功效;δ表示P2/P1之间“尝试后纠错相对答案先行”的效果差,单位为成绩SD。

输入差中之差δ 每相关格完整n 平衡六格完整N
.20 785 4,710
.40 197 1,182
.60 88 528

主体B以δ=.40为例不足以达到80%交互功效,因此交互保持探索性,报告六组均值与区间;不显著不是没有交互的证据。以上也未为多项交互分配家族错误率。

2.5 C:生态独立迁移敏感性

双侧α=.05、90%功效、两组平衡、25%失访;此计算针对第12周主要成绩,不给持续注意探索指标提供功效保证。

输入d 两组最低完整N 最低招募规划
.25 674 900
.35 344 460
.45 208 278

主体规划招募480人,每组240,预计第12周约360人有数据;假定d=.35。若存在聚类、失访更多或最小重要效应更小,须增加人数或明确降低确认性范围。

B2可选研究以d=.30、α=.05、90%功效需要约468人有延迟数据;15%失访后最低招募552,规划560。它不计入主体人数。

3. 预试到预注册的决策规则

  1. 用独立先导样本检验题目难度、评分可靠性、操作成本的可察觉性、分支语义和时机操纵。先导不用于检验主效应是否显著。
  2. 锁定最小重要差异、基线事件率范围、失访情境和分析模型;在多套参数下模拟功效和区间宽度。重点包括A的二元风险、B的分数分布/题目效应、C的领域与失访。
  3. 如果小于规划差异的效应仍具有学术意义,增大样本或改为精度研究;不能把资金允许的N逆称为“充分功效”。
  4. 记录对设计的每项修改、日期和依据;正式随机化前冻结主要对比、题目、模型版本、提示、编码本和缺失方案。预注册可以在已有数据之前修订并说明。
  5. 固定样本停止规则,公开招募与缺失流程。正式入组后不得因阶段性显著或不显著随意增减样本。

依据:Lakens,2022;Lakens与Caldwell,2021。以上是可复算近似规划,未声称已完成最终蒙特卡洛功效验证。

4. 对话过程编码手册

开始前记录主目标、完成标准与计划子问题。分析单位为语义动作,需保留前后文。编码员按冻结的主任务评分规则判断当时目标是否闭合;用户有理由改变目标时,记录修订,不机械判为偏离。

代码 定义 示例,均为本项目拟制
G 推进原目标,包括反例与核验 主目标比较两种实验设计;追问“这一分组是否造成混杂?”
B 新支线有可说明的工具作用 为判断分组问题,补问随机分配与随机抽样的区别
U 原目标未闭合时进入缺少任务联系的新目标 仍在分析分组,却转问与任务无关的旅行安排
R 从U回到原目标 “回到刚才的实验,这个偏差如何排除?”
M 操作、寒暄或界面说明 “这段回答没有显示完整,请重新显示。”
? 目标关系证据不足 用户突然提新术语,日志不能判断是否有任务作用

A主结果以首个符合U定义的事件判断,不要求后续两次发言。后续持续多久、是否返回和是否完成属于独立次要结果。“持续两动作未返回”只作敏感性定义;会话末尾不足两动作的情况报告删失/不确定,不能当作无事件。

G/B/U/R/M是本项目新拟编码,不是已验证量表。合理探索可以跨子题而仍是G/B;即使一个反例追问未在事前计划中列出,只要它提供完成原任务所需的反证、必要前提或可靠性核查,也按G/B编码。只有缺少可说明的功能联系才标U。发现U只说明可见配置变化,不能直接判定学习损害。

自主认知贡献

等级 可见贡献 评分边界
0 请求/照搬结论,没有可观察加工 不表示内心完全没思考
1 复述、摘取或局部操作 正确复述也不自动证明迁移
2 新解释、比较或有依据的因果连接 错误推论仍可编码为生成,但质量另评
3 有理由的反例、证据核验或修正 只说“我不同意”不足以得到3

先尝试条件会增加可见表达机会,故该指标首先是过程指标,不能代替无AI学习测验。比例和事件率分别报告;使用固定时间作分母,避免轮数受处理改变造成假象。

至少20%正式会话按条件、题目、长度分层双人独立编码。训练使用先导数据;冻结后报告原始一致率、逐类混淆和机会校正一致性,并保留第三人仲裁。评分员可能从措辞猜到条件,需报告盲法限度。自动编码须用独立人工样本验证,不能只让同一生成模型评自己的输出。

理论起点:Chi与Wylie,2014。

5. 独立迁移评分与信心校准

拟定主成绩0–20分,四维各0–5。主测试给出反例,评价处理反例的能力;另用不提示反例的开放题观察自发行为。题目与锚点均须预试,本附录只给评分原则。

维度 0分锚点 约3分锚点 5分锚点
事实/概念准确性 关键概念错误或缺失 核心正确但有重要遗漏 关键概念正确且适用条件明确
因果解释 只给结论或错误因果 给出主要机制但连接不完整 解释机制、条件与推论,区分相关和因果
证据整合 无依据或捏造依据 使用相关证据但未权衡冲突 比较证据,解释冲突与权重
给定反例处理 忽略或误解反例 辨认反例但权重或适用条件说明不完整 准确权衡反例,并有根据地维持、缩窄或修订判断

不按字数或观点改变本身加分。反证不必推翻原观点,有根据地维持判断也可以得到满分;盲评不按最终立场方向加分。捏造材料中不存在的事实须按具体题目评分点扣分;不临时给整个长文贴“差”标签。每一分档的边界须在题目手册中写明,至少20%答卷独立双评;不同组采用同一匿名评分流程。

客观选择题附0–100%信心,报告平均过度自信(信心−实际正确率)、校准图和适当的概率评分;开放题另报告预估得分与真实得分之差,不能把二者混在同一“校准指数”。Fisher等,2015提供工具使用后自我知识判断的研究先例,并非当前指标已验证的证明。

6. 最小数据字典

字段 用途
匿名参与者ID、研究编号、随机区组、指派条件 ITT分母与随机化核验
基线知识、兴趣、阅读指标、AI经验、即时偏好 前处理变量及探索性异质性
模型/提示/事实库版本、时间戳、技术故障 复现处理与忠实度
候选展示、可见位置、打开、忽略、实际回复延迟 实际暴露与界面过程
主目标、完成标准、目标修订及理由、语义动作码 目标连续性与切换
用户贡献码、AI正确性/反证/语气码 加工与处理污染
协同产出、即时无AI、延迟无AI成绩及评分员 区分系统表现与个人学习
信心、疲劳/睡眠、测试时段、设备 校准和注意任务解释
开始/退出/失访原因、外部工具自报 缺失与遵从分析

“外部工具使用”只收集必要自报,不记录私人浏览历史。原始自由文本不默认公开;共享数据以充分去标识化、聚合或经同意的片段为主。

7. 中介和结论的限制

随机化识别设计政策的总效应,切换与自主加工没有被自动随机化。即使过程码与成绩相关,也可能存在能力、动机和处理后的内容质量混杂。中介模型需预先说明识别假设并做敏感性分析;若不可辩护,只报告与路径相符的过程证据。Imai、Keele与Tingley,2010

若只见过程码变化而无独立学习变化,应报告过程变化;若无显著差异但区间很宽,应报告不确定。若独立学习和协同效率方向不同,应同时报告权衡。一般持续注意另由独立任务检验,不由上述代理推定;gradCPT原始任务见Rosenberg等,2013。

8. 主体招募与资源算术

先导60 + A512 + B990 + C480 = 2,042名拟招募参与者,各研究另招且互不重叠;不包含可选B2。加入B2的560人后为2,602。正式人数仍须依先导与资源锁定。

可以用以下输入表估算预算:先导报酬×60、A报酬×512、B含随访报酬×990、C含追踪报酬×480;再加平台开发、模型调用、题目审查、双人标注、随访与数据管理。此处不假称掌握市场报价,也未把开发和标注成本记为零。

来源与检索台账

核验与检索截止:2026-10-07。配套文献综述、研究计划与方法附录。本台账记录本次写作使用的版本、测量和访问边界;没有重新分析原研究数据。

1. 检索范围和可重复性

本项目采用聚焦式检索与引文追踪,通过网络学术索引定位题名/DOI,再查看期刊正式版、作者机构原稿、PubMed/Europe PMC 和正式更正。没有直接完成 PsycINFO、Web of Science、Scopus、CNKI 的全量检索,没有预注册综述协议、穷尽式双人筛选或标准化偏倚评分;因此交付的是批判性整合综述,不能标为系统综述。本次正文列29项参考文献,其中一项为正式更正。

原始观点检验及第一轮对话补检的检索词、R01–R27书目与访问情况保留在此前证据台账。其中有关内容生产和短视频的条目属于问题形成背景,不能自动视为本综述全部纳入或主要依据。

本轮集中检索:cognitive offloading;switching costs information foraging;conversational search learning;LLM versus web search depth learning;personalized dialogue sycophancy;immediate delayed feedback;generative AI self-regulated learning;generative AI learning outcomes meta-analysis。另用题名、DOI及作者/期刊域名定向核验,与原讨论的中文补检衔接。纳入实验、相关元分析、原始理论及方法文献;新闻、产品页面仅作线索。检索依据调整后的研究问题逐步补充,并非一个固定数据库检索式的一次性执行。

检索返回记录、访问受限记录及已取得的开放原文保存在工作资料中;没有把搜索索引视为完整全文。下面逐条区别全文、原摘要/部分方法索引和书目核验。此记录足以追溯引用依据,但不能复现商业搜索引擎在不同时点的排序,更不能提供未执行过的PRISMA筛选流图。

2. 既有关键来源的进一步判读

既有条目 本次引用的边界
R15与R27,Salvi 2025及2026更正 个性化GPT-4相对人类优势仍保留;与非个性化GPT-4直接比较更正为p=.0678。不能确认额外收益完全来自个性化,也没有测注意或学习。
R17,Bastani 2025 无辅助考试紧接有辅助练习、在同一90分钟课次内;不是数日后保持测验。提示导师还获得教师提供的正确解法与常见错误,不能单独识别提示策略。
R18,Kestin 2025 即时后测;同时比较自定步调/在家与课堂教学环境。未独立随机化个性化、反馈时机或对话形式,也没有长期注意测验。
R21,Stadler 2024 自报负荷和论据/建议质量;不是持续注意或长期知识测验。
R22,Melumad与Yun 2025 “深度”主要为自报新学习、全面性/归属感,建议文本特征和接收者评价;不是标准化独立理解或迁移。固定核心事实的比较仍同时改变综合与呈现需求。摘要/正文总人数口径不一致,不引用总N。
R23,Kim与Ji 2026 出版商摘要及部分方法索引,小样本;感知知识量表信度有限,不能替代客观学习。未核完整统计表。
R24,Cheng 2026 采用Science正式版3项预注册人类实验、N=2405,不沿用旧预印本2项/N=1604。人际判断和修复意愿,不是持续注意或临床依赖。
R25与R26,Tankelevitch及ICAP 理论起点,不能充当AI损害认知的实验结论。外显贡献不能完整揭示内在思维。

以上优先于把“撤去工具”“学习深度”等词不加区分地解释为长期能力变化。正式版、正式更正、作者稿和摘要的层级始终分别保留。

3. 新补入综述的来源与边界

以下N编号仅用于本补充台账,不修改旧R编号。

N01

Fan, Y., Tang, L., Le, H., Shen, K., Tan, S., Zhao, Y., Shen, Y., Li, X., & Gašević, D. (2025). Beware of metacognitive laziness: Effects of generative artificial intelligence on learning motivation, processes, and performance. British Journal of Educational Technology, 56, 489–530. 原文/DOI

117人随机分配至ChatGPT、人类专家、写作分析或无支持,比较作文修改、学习过程、知识增益和迁移。AI支持的修改表现提高,知识增益/迁移差异未显著;不能将不显著称为等效,也不能把标题中的“懒惰”当能力诊断。访问:期刊摘要及方法/结果索引、作者研究记录;没有重新分析原始数据。

N02

Sharma, N., Liao, Q. V., & Xiao, Z. (2024). Generative Echo Chamber? Effect of LLM-Powered Search Systems on Diverse Information Seeking. CHI ’24, Article 1033. 原文/DOI

两项实验(N=115、213)比较LLM对话搜索与传统搜索,并研究强化用户立场的系统。观察到确认性查询增加;选择性接触不同于无计划换题或持续注意。正式会议题名用Effect,作者预印本/机构页面可见Effects。访问:作者机构页面和作者稿全文v2。

N03

Mittal, S., Blodgett, S. L., & Liao, Q. V. (2026). Learning by Chatting? Investigating the Impact of Generative AI on Information Seeking and Learning. arXiv, v2, 7 Aug 2026. 原文/DOI

八天日记实验,80人入组、35人完成进入分析(ChatGPT14、Google21)。总学习比较未达作者采用的显著性标准;逐题和访谈解释为探索性。高失访及日记自报限制因果外推。本文使用arXiv v2(2026-08-07)全文;作者主页虽列AIES2026,本次未取得正式会议版本,不能以此冒充已核正式版。访问:所读全文v2。

N04

Nakamura, D. (2026). Augmentation or Erosion? Regulating Cognitive Offloading in Generative AI-Supported STEM Learning. Educational Psychology Review, 38, 124. 原文/DOI

2026-10-01正式发表的理论综述,提出目标依赖的辅助性/学习构成性外包区分及七项条件命题。与本假说邻近,必须用于限定新意;不是新参与者试验。访问:Springer开放正式全文。

N05

Risko, E. F., & Gilbert, S. J. (2016). Cognitive offloading. Trends in Cognitive Sciences, 20(9), 676–688. 原文/DOI

认知外包研究综述与理论框架。外包可以帮助即时完成,也可能减少目标所需练习;并非LLM实验。访问:作者原稿全文。

N06

Fisher, M., Goddu, M. K., & Keil, F. C. (2015). Searching for explanations: How the Internet inflates estimates of internal knowledge. Journal of Experimental Psychology: General, 144(3), 674–687. 原文/DOI

九个网页搜索实验研究自我知识估计;一项比较匹配解释内容与时间。自评上升不能解释为客观能力下降,也不是AI效应。访问:耶鲁作者原文全文。

N07

Liu, X., Chin, J., Payne, B. R., Fu, W.-T., Morrow, D. G., & Stine-Morrow, E. A. L. (2016). Adult age differences in information foraging in an interactive reading environment. Psychology and Aging, 31(3), 211–223. 原文/DOI

72名成人的互动阅读实验,操纵切换等待与信息丰富度;停留及已选材料条件回忆改变。等待同时消耗固定总时间,不能推出总体信息量增加。访问:APA原文全文及PubMed原摘要。

N08

Corral, D., Carpenter, S. K., & Clingan-Siverly, S. (2021). The effects of immediate versus delayed feedback on complex concept learning. Quarterly Journal of Experimental Psychology, 74(4), 786–799. 原文/DOI

三个复杂概念学习实验:实验1/2无反馈时机差异,实验3更长延迟有优势。任务/日程不同,不能直接映射秒级AI等待。访问:出版商原摘要和书目信息;全文受限,没有据此引用未核统计细节。

N09

Kulik, J. A., & Kulik, C.-L. C. (1988). Timing of feedback and verbal learning. Review of Educational Research, 58(1), 79–97. 原文/DOI

53项反馈时机研究的原始元分析;课堂/实验室安排下方向不同。前数字媒介时代,不是AI效应。访问:出版商原摘要;未取得全部全文与效应表。

N10

Graesser, A. C., Chipman, P., Haynes, B. C., & Olney, A. (2005). AutoTutor: An intelligent tutoring system with mixed-initiative dialogue. IEEE Transactions on Education, 48(4), 612–618. 原文/DOI

早期混合主导权AutoTutor系统与研究汇述,包含教学脚本、追问、纠错等设计包。说明对话教学可能支持推理;不能当作纯对话效应或单一大型RCT。访问:孟菲斯大学所载原论文全文。

N11

Soderstrom, N. C., & Bjork, R. A. (2015). Learning versus performance: An integrative review. Perspectives on Psychological Science, 10(2), 176–199. 原文/DOI

学习与表现的整合综述;即时流畅性、保持与迁移不等价。为结果区分提供基础,不是AI特有实验结论。访问:UCLA作者原文全文。

N12

Han, X., Peng, H., & Liu, M. (2025). The impact of GenAI on learning outcomes: A systematic review and meta-analysis of experimental studies. Educational Research Review, 48, 100714. 原文/DOI

68项实验/准实验、337个效应,报告GenAI教育干预平均积极结果及高异质性。积极结果必须与特定负面研究共同报告;不直接检验目标切换或一般注意。访问:出版商原摘要及部分方法索引,未独立重分析效应依赖或完整偏倚判断,正文不借用平均效应量为本计划功效输入。

4. 研究计划方法来源的完整书目

优先正式版、出版社页面和PubMed记录,书目信息以DOI主元数据交叉核对。下列条目用于设计依据,不表示已完成相应量表验证、功效模拟或伦理批准。

方法来源 核验后的书目条目 核验链接与访问/引用边界
自我解释 Chi, M. T. H., de Leeuw, N., Chiu, M.-H., & LaVancher, C. (1994). Eliciting self-explanations improves understanding. Cognitive Science, 18(3), 439–477. DOI Wiley 正式版、作者机构原文;期刊书目信息已核。原研究不是生成式 AI 实验。
检索练习 Roediger, H. L., III, & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255. DOI SAGE 正式摘要、PubMed;出版社注明 Roediger 后缀 III。其两实验比较无反馈自由回忆测验与再学习,最终测验为 5 分钟、2 天或 1 周后;不能作为即时纠错的直接证据。
思绪探针构念 Kane, M. J., Smeekens, B. A., Meier, M. E., Welhaf, M. S., & Phillips, N. E. (2021). Testing the construct validity of competing measurement approaches to probed mind-wandering reports. Behavior Research Methods, 53(6), 2372–2411. DOI Springer 开放正式版。原文有 2021-09-10 更正,已更新文章可读;更正全文受限,故不猜其具体改动。探针题项问“内容/意图/离题程度”会影响构念解释。
探针数量 Welhaf, M. S., Meier, M. E., Smeekens, B. A., Silvia, P. J., Kwapil, T. R., & Kane, M. J. (2023). A “Goldilocks zone” for mind-wandering reports? A secondary data analysis of how few thought probes are enough for reliable and valid measurement. Behavior Research Methods, 55(1), 327–347. DOI Springer 原文、PubMed 35381956。2022-04-05 在线、2023 年卷期发表,参考文献依正式卷期用 2023。二次数据分析中约 8 个探针是传统认知任务的暂定建议;未证明对话任务最优数量或探针反应性。
gradCPT 原始任务 Rosenberg, M., Noonan, S., DeGutis, J., & Esterman, M. (2013). Sustaining visual attention in the face of distraction: A novel gradual-onset continuous performance task. Attention, Perception, & Psychophysics, 75(3), 426–439. DOI PubMed 原始摘要、Springer 正式版。2013 为原始 gradCPT 文献,2014 年 Esterman、Noonan、Rosenberg 与 DeGutis 论文为后续使用/研究,不能称原始来源。
因子实验功效 Lakens, D., & Caldwell, A. R. (2021). Simulation-based power analysis for factorial analysis of variance designs. Advances in Methods and Practices in Psychological Science, 4(1), Article 2515245920951503. DOI SAGE 正式版、作者机构页面与 PDF。该条是模拟因子 ANOVA 功效教程,不等于已为本研究计算样本量;若最终用混合模型或失访机制,仍需按计划模型另模拟。
中文 NASA-TLX 马琳琳,潘志刚. (2018). 中文版主观负荷评估法量表和美国国家航空航天任务负荷指数量表评估三级医院内科医生脑力负荷的信效度研究. 中国全科医学, 21(33), 4127–4133. DOI 期刊正式页面、原 PDF;正式年为 2018,非 2019。便利抽样三级医院内科医生,105 份有效问卷;可作为中文语句来源,不能自动视为学生/一般成人样本中的量表效度证据。中文 DOI 在 Crossref 查询返回 404,因此以期刊原站为准。
随机试验报告 Hopewell, S., Chan, A.-W., Collins, G. S., et al. (2025). CONSORT 2025 statement: Updated guideline for reporting randomised trials. BMJ, 389, e081123. DOI BMJ 正式页面、原 PDF;2025-04-14 发表,39 位作者,正式版本 30 项清单与参与者流程图。网页直接打开返回 403,但出版商检索索引与 Crossref 主元数据一致。用于报告清单,不替代研究设计质量评价。
随机试验方案 Chan, A.-W., Boutron, I., Hopewell, S., et al. (2025). SPIRIT 2025 statement: Updated guideline for protocols of randomised trials. BMJ, 389, e081477. DOI BMJ 正式页面、原 PDF;2025-04-28 发表,39 位作者,正式版本 34 项最小方案条目。网页直接打开返回 403,但出版商检索索引与 Crossref 主元数据一致。适用于方案透明报告,不能靠勾选清单证明设计充分。

另四项方法依据

  • Imai, K., Keele, L., & Tingley, D. (2010). A general approach to causal mediation analysis. Psychological Methods, 15(4), 309–334. DOI。用途:区分随机策略总效应与自然中介识别;DOI与机构存档核对,没有对本项目做中介因果计算。
  • Lakens, D. (2022). Sample size justification. Collabra: Psychology, 8(1), 33267. 正式版。用途:最小重要效应、精度与资源约束的区分;正式原文可访问,不能用它证明当前情境人数充分。
  • Eysenbach, G. (2011). CONSORT-EHEALTH: Improving and standardizing evaluation reports of web-based and mobile health interventions. Journal of Medical Internet Research, 13(4), e126. 正式版。用途:数字干预版本、使用与失访报告;官方期刊页面核对,属于报告规范而非认知损害证据。
  • ICH. E9(R1): Statistical principles for clinical trials—Addendum: Estimands and sensitivity analysis in clinical trials. FDA官方指南页。用途:借鉴估计目标与干预后事件的清晰定义;本项目不是临床试验,不宣称受该指南批准或已满足全部条款。

5. 旧台账中以原文链接记录的DOI定位补充

条目 DOI定位及原文判读边界
R02,Lorenz-Spreen等(2019) Accelerating dynamics of collective attention。期刊全文已核;集体话题热度,非个体持续注意能力。
R06,Wiradhany与Nieuwenstein(2017) Cognitive control in media multitaskers: Two replication studies and a meta-analysis。Europe PMC全文已核;重复与小研究效应限制,非AI实验。
R07,Tam与Inzlicht(2024) Fast-forward to boredom: How switching behavior on digital media makes people more bored。原摘要与论文正文索引已核;当下主观投入和无聊,非长期能力。
R15,Salvi等(2025) On the conversational persuasiveness of GPT-4。按2026更正共同判读,详见R27及本台账第2节。

6. 使用规则及后续更新

  1. 本综述的因果判断以各研究的实际处理和实际测量为单位;不能跨层次合成为“AI让注意力退化”的结论。
  2. 仅取得原摘要或部分方法时,不引用全文才可核验的精细统计与机制;版本受限已逐项说明。
  3. 正式预注册前更新检索与更正,锁定中文题库、版权、评分本、模型版本和处理忠实度;目前没有宣称完成。
  4. 样本量敏感性公式与结果在方法附录;可读取的规划输入与结果是本次计算留档,不是原研究数据或已观测效应。
  5. 全文可读、网页曾被索引、书目存在与所有链接长期可用是不同状态;本次没有声称所有外链可在任何网络无障碍访问。

证据台账:AI 生成内容、信息多样性与注意力

检索日期:2026-10-07。用于同目录《学术讨论_AI生成内容与注意力.md》。

方法与限制

本次采用聚焦式批判性文献检索:经网络学术索引定位研究,在期刊、作者机构、PubMed/Europe PMC 与原论文中核对结论,追查元分析引用的反例,并补检 2026 年研究。没有声称直接运行 PsycINFO、Web of Science、Scopus 或 CNKI 的完整数据库检索。没有完成双人筛选、预注册、正式偏倚评分或重新汇总效应量,不能称为完整系统综述。

优先保留元分析、随机干预、重复研究与匹配内容的实验;横断面调查用于描述关联,理论文献用于解释机制。新闻、营销报告和社交媒体仅用于发现线索,不作为科学结论依据。检索的文献涉及不同处理与结果,未进行不适当的统一合并。

检索词组包括:

检索目的 实际使用的代表性词组
宏观信息能力 Hilbert Lopez 2011 world technological capacity store communicate compute information 28%
集体注意历史变化 Lorenz-Spreen 2019 accelerating dynamics collective attention Nature Communications
短视频总体证据 short form video use cognition mental health systematic review meta analysis 2025 Psychological Bulletin attention 71 studies;Feeds, feelings, and focus
因果与不一致证据 Understanding the Effects of Short-Form Videos on Sustained Attention;Context-switching in short-form videos results;digital switching increases boredom Tam Inzlicht 2024 experiments
手机联网干预 blocking mobile internet smartphones improves sustained attention PNAS Nexus 2025 randomized
多任务关联与重复 media multitasking cognitive control meta analysis 2021 Parry le Roux 118
实际接触多样性 Exposure to ideologically diverse news Bakshy Messing Adamic 2015 Science
AI 生产与趋同 Experimental evidence productivity effects generative artificial intelligence Noy Zhang 2023;generative AI enhances individual creativity reduces collective diversity Doshi Hauser 2024
AI 说服与思考 personalized GPT-4 persuasion randomized controlled trial Salvi 2025;generative AI critical thinking Lee 2025 CHI 319 936 Microsoft research
AI 学习差异 generative AI without guardrails harms learning Bastani 2025 PNAS randomized trial;AI tutoring outperforms active learning Kestin 2025 Scientific Reports randomized controlled trial
最新直接证据 generative AI content sustained attention attention span longitudinal randomized study 2026;AI generated video attention cognitive short form experiment 2025 2026
中文与微短剧 短剧 注意力 实证 研究
理论解释 opportunity cost model subjective effort task performance Kurzban 2013

检索还使用了题名、DOI 与机构域名的精确查询。检索未找到可以直接确认“电影—电视剧—微短剧—短视频”的同口径、全人口、长期能力退化链条的研究;这只是本次检索的证据缺口,不是文献绝对不存在的证明。

核心文献与判读

R01. Hilbert, M., & López, P. (2011). The world's technological capacity to store, communicate, and compute information. Science, 332, 60–65. DOI;PubMed。历史容量估计,覆盖 1986–2007 年;双向通信能力年增约 28%,存储约 23%。这是技术容量,不是个人语义多样性。访问:原论文摘要与作者资料。

R02. Lorenz-Spreen, P., Mønsted, B. M., Hövel, P., & Lehmann, S. (2019). Accelerating dynamics of collective attention. Nature Communications, 10, 1759. 期刊全文。跨域纵向数据加竞争模型;Twitter 热门标签在前 50 位停留均值从 2013 年 17.5 小时至 2016 年 11.9 小时。科学引文与 Wikipedia 未见同等加速;结果为集体注意代理,非个人能力。访问:全文 Results 与 Methods。

R03. Bakshy, E., Messing, S., & Adamic, L. A. (2015). Exposure to ideologically diverse news and opinion on Facebook. Science, 348, 1130–1132. DOI。10.1 百万美国用户的新闻接触观察;社交网络、排序与个人点击共同改变接触分布。局限:当时平台、自报政治立场用户与新闻领域,不能推广为所有算法必然收窄多样性。访问:原论文摘要及高校存档原论文。

R04. Nguyen, L., et al. (2025). Feeds, feelings, and focus: A systematic review and meta-analysis examining the cognitive and mental health correlates of short-form video use. Psychological Bulletin, 151, 1125–1146. DOI;PubMed;官方补充材料。综述纳入 71 项、98,299 人,70 项进入元分析;认知 14 项,注意力子分析 k=5,r=−.38,95% CI [−.52,−.22]。认知总体 I²=95.73%;87% 为相关研究。一般使用与成瘾指标不可混用。访问:Europe PMC 元数据及原期刊 PDF 的 p.1131–1132;出版商访问受限,全文经公开镜像核对。

R05. Parry, D. A., & le Roux, D. B. (2021). “Cognitive control in media multitaskers” ten years on: A meta-analysis. Cyberpsychology, 15(2), Article 7. 期刊全文。纳入 118 个评估,总体关联较小且随测量和结果变化;不能视为强一致的能力损害证据。访问:期刊全文/摘要。

R06. Wiradhany, W., & Nieuwenstein, M. R. (2017). Cognitive control in media multitaskers: Two replication studies and a meta-analysis. Attention, Perception, & Psychophysics, 79, 2620–2641. 全文。两项重复研究及 39 个效应量;弱关联经小研究效应校正后不显著。说明早期结果的稳健性有限;不显著亦非证明所有条件下无影响。访问:Europe PMC 全文 XML。

R07. Tam, K. Y. Y., & Inzlicht, M. (2024). Fast-forward to boredom: How switching behavior on digital media makes people more bored. Journal of Experimental Psychology: General, 153, 2409–2426. 原论文;PubMed。7 个实验,合计 1,223 人,6 个预注册;视频切换加重无聊并降低主观注意、意义与满意度。文章和非大学样本结果较不明确;不能外推为持久注意能力退化。访问:原论文摘要与全文索引。

R08. Chiossi, F., Haliburton, L., Ou, C., Butz, A., & Schmidt, A. (2023). Short-Form Videos Degrade Our Capacity to Retain Intentions: Effect of Context Switching On Prospective Memory. CHI ’23. DOI;作者机构论文。N=60,比较 TikTok、Twitter、YouTube 和休息条件;TikTok 条件的前瞻记忆表现较差。平台差异含多重特征,不单独识别时长;不是一般持续注意量表。访问:机构原论文。

R09. Barton, N., & Smyth, M. (2025). Context-switching in short-form videos: What is the impact on prospective memory? Memory, 33, 788–801. 期刊论文。N=45,比较无限切换、限制切换与无视频;无限切换后前瞻记忆变差,限制切换组改善。小样本、即时结果;支持考察切换节奏而非仅看媒介名称。访问:期刊索引全文与摘要;直接打开遇访问限制。

R10. Lin, B.-H., et al. (2024). Understanding the Effects of Short-Form Videos on Sustained Attention. CHI Extended Abstracts ’24, Article 352. DOI;作者机构记录。调查发现负向关联,田野实验改变观看时长后多数持续注意测试未显著改变。会议扩展摘要、初步研究;不能用来证明短视频无害。访问:机构摘要及官方 ACM SIGCHI 作者报告;未以二手综述代替原摘要核对。

R11. Castelo, N., Kushlev, K., Ward, A. F., Esterman, M., & Reiner, P. B. (2025). Blocking mobile internet on smartphones improves sustained attention, mental health, and subjective well-being. PNAS Nexus, 4, pgaf017. DOI;全文。467 名独立参与者;两周限制联网后 gradCPT 改善,首阶段组内 d_z=.24。只有 119 人满足预注册遵从标准;主分析为完整案例。干预涉及全部手机联网及生活方式变化,不能归因于短视频或 AI。访问:Europe PMC 全文及期刊 Methods。

R12. Wei, M., Liu, J., Wang, H., Li, Q., & Dong, G.-H. (2026). Fragmented learning from short videos modulates neural activity and connectivity during memory retrieval. npj Science of Learning, 11, 15. 期刊全文。57 人随机分组;总时间及内容匹配下,短视频组即时记忆较差并见 fMRI 差异。叙事连贯性未完全匹配,样本为大学生;脑活动差异不等于长期损伤。访问:Europe PMC 全文 XML。

R13. Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381, 187–192. DOI;作者机构论文。453 名专业人员写作随机实验:平均完成时间减少 40%,质量提高 18%。支持特定任务中生产成本下降,不直接测量媒介供给量、社会注意或所有职业。访问:期刊原摘要与作者稿索引。

R14. Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10, eadn5290. DOI;全文。293 名写作者、600 名评价者;AI 构思提高故事评价,同时作品间语义相似性增加。题材与普通写作者受限,不能推广为全部 AI 内容趋同。访问:Europe PMC 全文 XML。

R15. Salvi, F., Horta Ribeiro, M., Gallotti, R., & West, R. (2025). On the conversational persuasiveness of GPT-4. Nature Human Behaviour. 期刊论文;PubMed。N=900,预注册对话实验;个性化 GPT-4 相对人类的更高辩后认同优势比增加 81.2%。这是优势比的相对变化,非认同概率提高 81.2 个百分点,也不是注意时长或现实平台效果。2026-10-07 补充核验:9 月更正将个性化与非个性化 GPT-4 的直接比较改为 p=.0678;不得把相对人类的优势解释为已经识别了个性化的额外因果收益,详见 R27。访问:期刊原摘要、结果、限制索引及作者机构所载更正。

R16. Lee, H.-P., et al. (2025). The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI ’25, Article 1121. DOI;作者机构页面。319 人、936 个任务实例;更高 AI 信心与较少自报批判思考相关,活动也向核验、整合转移。自报调查,不证明一般能力或注意的因果退化。访问:作者机构原摘要与论文。

R17. Bastani, H., et al. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS, 122, e2422633122. DOI;全文。土耳其一所高中近千人班级随机实验;普通 AI 练习成绩提高,但撤去后考试相对对照低约 17%(约 −5.4 百分点);提示式导师减轻负面结果、未显著优于对照。单校、数学、短期。2025 年更正只涉及作者机构。访问:Europe PMC 全文及更正。

R18. Kestin, G., et al. (2025). AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15, 17458. DOI;全文。194 名大学物理学生、两次课交叉设计;结构化 AI 导师提高即时后测表现,学习时间中位数 49 分钟。比较同时涉及在家自定步调与课堂环境;非通用聊天工具或长期注意提升证据。访问:Europe PMC 全文 XML。

R19. Shi, D., et al. (2026). Perceived authenticity drives gaze behavior when watching AI-generated videos of physical scenes. Scientific Reports. 期刊论文。40 人眼动研究;对来源的感知与观看及寻找异常的方式有关。测量凝视而非长期注意能力,仅作核验机制的补充证据。访问:期刊索引及官方 accepted manuscript 摘要。

R20. Kurzban, R., Duckworth, A., Kable, J. W., & Myers, J. (2013). An opportunity cost model of subjective effort and task performance. Behavioral and Brain Sciences, 36, 661–679. DOI;作者稿。理论模型将主观努力与替代活动的机会成本联系。用其解释 AI 信息流属于外推,不是论文的 AI 实证结论。访问:原摘要及作者稿索引;全文 XML 接口失败。

对话式获取与个性化:补充检索

补充检索日期同为 2026-10-07。根据用户修正,优先考察对话式信息获取、认知投入、个性化反馈与自主探索,不以内容生产成本作为主要解释变量。本次仍为聚焦式检索,不是系统综述。

检索式包括:LLM versus web search depth learning;Cognitive ease at a cost;Exploratory search with generative AI interaction design;The Metacognitive Demands and Opportunities of Generative AI;Sycophantic AI decreases prosocial intentions and promotes dependence;ICAP framework constructive interactive;On the conversational persuasiveness of GPT-4 Author Correction。纳入下列原始研究、原始理论框架与更正,未把新闻报道作为证据。

R21. Stadler, M., Bannert, M., & Sailer, M. (2024). Cognitive ease at a cost: LLMs reduce mental effort but compromise depth in student scientific inquiry. Computers in Human Behavior, 160, 108386. DOI;德国国家图书馆所载原论文。91 名大学生随机使用 ChatGPT-3.5 或 Google,研究防晒霜中纳米颗粒并提出建议。LLM 组自报认知负荷较低,最终论证包含的相关论据较少;论证质量组间 p=.001,η²=.11。单一任务、旧模型、短期结果;探索性中介分析不能独立识别完整因果机制。访问:原论文 PDF 与出版商方法、结果索引;不是客观持续注意测验。

R22. Melumad, S., & Yun, J. H. (2025). Experimental evidence of the effects of large language models versus web search on depth of learning. PNAS Nexus, 4(10), pgaf316. DOI;全文。7 个实验比较 LLM 综合答案与传统网页搜索;在学习后给别人建议的任务中,LLM 条件的自报学习深度及建议的丰富程度较低。其中一个实验控制事实内容,仅改变结果呈现形式。指标主要是自报、文本特征与建议接收者评价,未做标准化持续注意测量或长期能力追踪。正文与摘要合计人数存在口径/数字不一致,因此本讨论不引用总人数。访问:PMC 原论文全文,特别核对限制部分。

R23. Kim, N., & Ji, Y. G. (2026). Exploratory search with generative AI: An empirical study on the impact of interaction design strategies on information exploration and cognitive load. International Journal of Human-Computer Studies, 210, 103771. DOI;出版商页面。36 人、2×2 被试内设计,考察渐进披露与用户提示主动性。研究报告了主观参与、感知知识变化和探索行为的改善。小样本,部分量表信度有限,不能把主观知识变化视为客观学习或长期注意改善。访问:出版商原摘要、Highlights、参与者和信度节的搜索索引;直接打开失败,未取得完整方法及统计表。

R24. Cheng, M., Lee, C., Khadpe, P., Yu, S., Han, D., & Jurafsky, D. (2026). Sycophantic AI decreases prosocial intentions and promotes dependence. Science, 391, eaec8352. DOI。正式版含 3 个预注册人类实验,N=2405;迎合性回应提高自认为正确的确信、信任/偏好,并降低承担责任和修复人际冲突的意愿。人际建议情境,不能推为全部认知领域或注意力损伤。采用正式版,未沿用旧预印本的 2 个实验、N=1604。访问:Science 结构化摘要与正式摘要的出版商索引;直接打开失败,未取得全部补充材料。

R25. Tankelevitch, L., Kewenig, V., Simkute, A., Scott, A. E., Sarkar, A., Sellen, A., & Rintel, S. (2024). The Metacognitive Demands and Opportunities of Generative AI. CHI ’24. DOI;作者稿。原始理论框架区分提问、评价输出和安排委托方式对元认知监控的要求。用于解释认知工作如何转移,不能充当“对话使注意变差”的实验结果。访问:ACM 原论文正文索引、作者稿与作者机构摘要。

R26. Chi, M. T. H., & Wylie, R. (2014). The ICAP framework: Linking cognitive engagement to active learning outcomes. Educational Psychologist, 49(4), 219–243. DOI;作者机构原论文。区分接收、操作、生成推论与共同建构;其“互动”要求双方作出实质性、建构性的贡献,不能仅按轮次或按钮点击判断。基于既有学习研究形成的理论框架,不是通用生成式聊天的直接实验。访问:原论文第 223–224 页关于互动定义与可观察行为的限制。

R27. Salvi, F., Horta Ribeiro, M., Gallotti, R., & West, R. (2026). Author Correction: On the conversational persuasiveness of GPT-4. Nature Human Behaviour. DOI;作者机构所载更正全文。2026-09-03 更正参考组计算错误;个性化相对非个性化 GPT-4 的直接比较由 p=.04 改为 p=.0678,不能据此确认个性化的额外优势。相对人类基线的结果仍保留。访问:期刊更正元数据、Crossmark 与普林斯顿原更正摘要全文。

使用边界

  • 上述证据强度只针对各论文实际测量的结果。随机试验也不自动解决外部效度或长期迁移问题。
  • r 是关联效应量,不能转为“注意时间减少的百分比”;不显著结果不能证明等效或绝对无影响。
  • 注意力元分析的子分析样本不能用整个综述的总人数代替。
  • 横断面相关、短期任务表现、学习成绩、眼动和集体热度,是不同结果。
  • 没有建立电影、电视剧、微短剧与短视频的单一线性历史替代关系,也没有用生成式 AI 的生产率证据替代注意力测量。
  • 预测表中的平台净效果与注意分化,是基于已有机制的条件性推论。

工作资料保存在 work/,包括网络检索返回记录、开放论文全文与访问记录;用户可复用的讨论与台账仅置于 outputs/。没有重新分析原始参与者数据。

样本量规划输入与结果

下表保留原规划数据的输入与计算结果;失访膨胀用于招募预算,不能作为排除未完成者的规则。最终人数仍待先导及实际分析模型的模拟。

研究输入效应双侧 α目标功效完整样本 N含失访招募 N
Ap₀=0.3,p₁=0.350.0590%3,6884,104
Ap₀=0.3,p₁=0.40.0590%9601,072
Ap₀=0.3,p₁=0.450.0590%440496
Bd=0.20.02590%1,8662,196
Bd=0.30.02590%828978
Bd=0.40.02590%468552
Cd=0.250.0590%674900
Cd=0.350.0590%344460
Cd=0.450.0590%208278
B_interaction_P2vsP1δ=0.20.0580%4,710未加入失访膨胀
B_interaction_P2vsP1δ=0.40.0580%1,182未加入失访膨胀
B_interaction_P2vsP1δ=0.60.0580%528未加入失访膨胀
B2_optionald=0.30.0590%468552
查看原始规划数据 / Original planning data
{
  "method": "large-sample normal approximations; independent homogeneous variances; no ANCOVA gains; no design effects; loss inflation is planning only, not exclusion rule",
  "rows": [
    {
      "study": "A",
      "p0": 0.3,
      "p1": 0.35,
      "alpha": 0.05,
      "power": 0.9,
      "n_per_C_level": 1842,
      "complete_N_8cells": 3688,
      "recruit_at_10pct_loss": 4104
    },
    {
      "study": "A",
      "p0": 0.3,
      "p1": 0.4,
      "alpha": 0.05,
      "power": 0.9,
      "n_per_C_level": 477,
      "complete_N_8cells": 960,
      "recruit_at_10pct_loss": 1072
    },
    {
      "study": "A",
      "p0": 0.3,
      "p1": 0.45,
      "alpha": 0.05,
      "power": 0.9,
      "n_per_C_level": 217,
      "complete_N_8cells": 440,
      "recruit_at_10pct_loss": 496
    },
    {
      "study": "B",
      "d": 0.2,
      "alpha": 0.025,
      "power": 0.9,
      "n_per_P_category_for_P2vsP1": 621,
      "complete_N_6cells": 1866,
      "recruit_at_15pct_loss": 2196
    },
    {
      "study": "B",
      "d": 0.3,
      "alpha": 0.025,
      "power": 0.9,
      "n_per_P_category_for_P2vsP1": 276,
      "complete_N_6cells": 828,
      "recruit_at_15pct_loss": 978
    },
    {
      "study": "B",
      "d": 0.4,
      "alpha": 0.025,
      "power": 0.9,
      "n_per_P_category_for_P2vsP1": 156,
      "complete_N_6cells": 468,
      "recruit_at_15pct_loss": 552
    },
    {
      "study": "C",
      "d": 0.25,
      "alpha": 0.05,
      "power": 0.9,
      "complete_N_2arms": 674,
      "recruit_at_25pct_loss": 900
    },
    {
      "study": "C",
      "d": 0.35,
      "alpha": 0.05,
      "power": 0.9,
      "complete_N_2arms": 344,
      "recruit_at_25pct_loss": 460
    },
    {
      "study": "C",
      "d": 0.45,
      "alpha": 0.05,
      "power": 0.9,
      "complete_N_2arms": 208,
      "recruit_at_25pct_loss": 278
    },
    {
      "study": "B_interaction_P2vsP1",
      "difference_in_differences_SD": 0.2,
      "alpha": 0.05,
      "power": 0.8,
      "n_per_relevant_cell": 785,
      "complete_N_6cells": 4710
    },
    {
      "study": "B_interaction_P2vsP1",
      "difference_in_differences_SD": 0.4,
      "alpha": 0.05,
      "power": 0.8,
      "n_per_relevant_cell": 197,
      "complete_N_6cells": 1182
    },
    {
      "study": "B_interaction_P2vsP1",
      "difference_in_differences_SD": 0.6,
      "alpha": 0.05,
      "power": 0.8,
      "n_per_relevant_cell": 88,
      "complete_N_6cells": 528
    },
    {
      "study": "B2_optional",
      "d": 0.3,
      "alpha": 0.05,
      "power": 0.9,
      "complete_N_2arms": 468,
      "recruit_at_15pct_loss": 552
    }
  ],
  "recruitment_scenarios": {
    "pilot": 60,
    "A": 512,
    "B": 990,
    "C": 480,
    "core_total": 2042,
    "B2_optional": 560,
    "with_B2_total": 2602,
    "status": "Planning assumptions; final N requires pilot-informed model simulations."
  }
}
↑ 顶部 / Top