第四讲:文献综合写作与数据准备清洗
文献综述的关键在于证据关系是否成立,而非句子是否好看;数据清洗的关键在于依据专业规则进行可复现的整理,而非简单删除不整齐的记录。
课程定位与课前准备
课程背景
上一讲已完成了文献矩阵(轮零显零散的文献整理)并从矩阵中找到研究空白、确定主选题。本讲解决两个核心问题:文献证据链的搭建与核验,以及数据证据链的建立与清洗。
课程讲授的七个讲解内容覆盖:
- 文献矩阵到综述提纲的转换
- 引用与证据链的核验
- 数据清洗的原则与方法
- 量化数据(问卷)清洗演示
- 质性数据(访谈)清洗演示
- 多专业案例讲解(心理学问卷、财务面板、访谈文本、工科时续信号)
- 课后练习与总结
课前准备要求
- 完成上一讲(模块三)中的文献阅读矩阵
- 确定好自己的主选题和研究问题
- 准备好待处理的数据
两个课前关键问题及其回答
问题一:已有十篇文献摘要,是否可以直接让 AI 写综述?
答案是否定的。原因:摘要不一定包含研究方法、局限等信息,直接写综述容易产生过度概括(即把摘要中的信息当作完整结论来使用)。
问题二:数据里有特别大的值,删掉就干净了吗?
这种表达有问题。原因:特别大的值可能是录入错误,也可能是真实的极端案例。正确做法是先核对来源并标记,不能只凭大小删除。
本课程同时处理两条证据链:
- 文献证据链:涉及文献真实性与论点支持度
- 数据证据链:涉及数据来源、规则与清洗流程
从文献矩阵到综述结构设计
不推荐的写法:堆沙式综述
常见错误写法示例:
- 张三研究了什么
- 李四研究了什么
- 王五研究了什么
这种写法的特点与危害:
- 每篇文献单独看都没有错
- 但读者读完后看不出研究之间的关系
- 每篇文献就像一粒沙子,数量虽多但没有组织成结构
- 结构上表现为 2.1、2.2、2.3 各自罗列某人做了某事
推荐的结构:主题聚类式综述
真正需要的不是把文献名单报一遍,而是告诉读者:
- 该领域形成了哪些主要认识
- 在哪里出现了分歧
- 分歧可能来自什么对象、数据和方法
- 现有证据还留下了什么问题
推荐的一篇综述文章段落结构:
- 核心概念出发 → 概念定义与边界界定
- 深入讲解背后影响机制
- 介绍学者们的方法分类
- 总结不足、方法目前的边界与未来方向
从文献矩阵中寻找聚类依据
主题聚类不能由 AI 根据标题随便分组,需回到文献矩阵中观察哪些列能真正回答研究问题。不同研究问题对应不同的聚类维度:
| 研究问题关注点 | 聚类维度建议 |
|---|---|
| 为什么(机制问题) | 按理论机制或中介路径聚类 |
| 对谁有效(异质性) | 按研究对象聚类 |
| 结论矛盾 | 按情境、时间、样本和方法聚类 |
| 质性研究 | 按核心概念、叙事模式或解释框架聚类 |
写出"综合感"的四步结构
分完主题后为防止一个主题下面变成文献罗列,使用共识、分歧、证据评价、研究缺口四步结构:
- 共识:先把这一组研究形成的共同认识写出来
- 分歧:说明他们在结论、对象或解释上不同
- 证据评价:分析分歧是否可能源于研究设计、样本测量或情境差异
- 研究缺口:自然引出仍需回答的问题
示范:短视频使用与青少年注意力
假设三篇研究发现高频使用与注意力困难相关,其中两篇是横截面问卷、一篇是短期实验,不能直接写成"短视频导致注意力下降"。更稳妥的表达方式:
现有研究普遍观察到二者之间存在关联,但因为多数证据来自横截面自陈述数据,因果方向仍不明确;短期实验提示即时干扰效应存在,但能否延伸到长期认知变化仍需进一步研究。
这段写法没有逐篇报名字,但每个判断都来自文献矩阵中的文献,且把证据强度和研究边界说明清楚。
用 AI 生成提纲的提示词与三项检查
课程演示了向 Codex 发送生成提纲的提示词(输入此前建立的文献矩阵文件)。提纲输出后不能只看标题是否漂亮,需要做三项检查:
- 每一个主题是否真的由文献支持
- 同一篇文献放进这个主题的理由是什么
- 这些主题能否共同回答研究问题
如果一个标题只是在重复题目的关键词,或一个主题下面只有一篇文献,需要继续合并、拆分或补充证据。主题分类是研究者的解释工作,不是机器自动聚类后就结束的。
引用与证据链的核验
三层引用核验
很多同学认为查到 DOI、论文真实就等于引用正确。这仅完成了第一层。引用核验至少包含三个层次:
| 层数 | 核验内容 | 说明 |
|---|---|---|
| 第一层 | 存在性 | 论文是否真实存在 |
| 第二层 | 身份一致性 | 引用情况的论文题目、作者、期刊号是否完全一致 |
| 第三层 | 语义支持度 | 原文论点是否能完全支撑引用处的表述,支持到什么程度 |
AI 幻觉的常见形式
AI 生成的幻觉性引用不一定是完全不存在的文献,更常见的是真文献配错观点——找到的是题目相关的文章,然后把希望得到的结果安在该论文身上。
因此,核验单位不是参考文献条目,而是论文中的一条具体论点。每条重要论点都要能回溯到原文中的具体位置。
论点-证据核验表的建立
完整的核验表应包含以下字段:
- 论文编号
- 论点(你写的论点内容)
- 引用的文献来源
- 文献真实性(作者、期刊号等信息核对)
- 原文数据(对应期刊论文中论点的具体位置)
- 支持程度(最重要的字段)
支持程度的四个等级:
- 完全支持:原文直接支持当前表述
- 部分支持:方向接近,但具体对象、方法、时间上存在差异
- 不支持:原文根本没有该结论,是强行把论点安在论文上
- 无法判断:仅凭摘要或部分信息,找不到原文论点
部分支持情况下的正确处理:不是简单把文献扔掉,而是缩小表述范围。例如:
- 原文只研究了某一所高校的学生,不能写成青少年普遍如此
- 原文报告的是相关关系,不能改成"导致"
- 原文说"可能与什么相关",不能改成"证明了一种机制"
生成核验表的操作流程
第一步:生成论点草稿。通过提示词让 AI 读取文献矩阵和文献大纲,输出初步论点草稿(包含编号、章节、论点、对应文献等字段)。
第二步:对论点进行三层核验。将论点草稿(部分论点)连同文献矩阵、原始 PDF、原数据文件发给 AI,输出核验证据链表。核验内容包括:文献真实性、编号、信息一致性、原文是否支持观点(AI 直接读取原文件,找到支撑论点的具体位置并标注支持程度)。
课程演示结果:前三个论点中,两个为完全支持,一个为部分支持。部分支持的需要适当缩小表述范围,AI 会给出原因和处理建议。
文献管理软件的使用提醒
Word 中尽量使用文献管理软件(前几讲中涉及的)的添加编辑和景分功能,使正文引用与文末参考文献保持联动。当原数据有误时在软件中修正后刷新,文档即自动更新。
引用核验判断题
| 题号 | 题目 | 答案 |
|---|---|---|
| 1 | DOI 能正常打开,这篇文献一定支持我的论点吗? | 错误 |
| 2 | 原文研究成年人,句中写大学生,算完整支持吗? | 错误 |
| 3 | 原文只报告相关关系,综述应避免改写为因果关系 | 正确 |
| 4 | 只有摘要时,可以标记"无法判断",等待全文核验 | 正确 |
补充:文献原数据的导出
核验提示词需要文献的原数据文件。具体操作方法:在文献管理软件中点击每个文献 → 右键 → 导出条目 → 选择 CSL JSON 文件格式。导出的是带摘要的文献原数据,补充该文件后可正常输出证据链核验表。
跨专业数据特征与共同原则
数据的"一行代表什么"问题
数据不只是 Excel 里的数字。不同领域中数据的行含义不同:
- 问卷数据:一行可能是一位受访者
- 财务面板数据:一行可能是一家公司在某一年度的记录
- 访谈数据:一行可能是一个说话轮次
- 时续信号:一行则可能是某一个采样时刻
如果连一行代表什么都没搞清楚,就无法判断什么是重复、缺失或异常。
四套教学数据
课程提供四套虚构(虚拟)教学数据,存放在工作区文件夹中:
- 心理学问卷数据:受访者编号 + 各题目的得分
- 财务面板数据:公司收入、资产、人员等金融领域记录
- 访谈记录:一来一回的问答构成,共 12 条
- 工科持续震动信号传感器采样数据:包含很多传感器采集的信号
为什么四种数据不能使用同一套清洗规则
问卷数据
问卷数字通常是有方向、有范围的测量编码。典型问题:
- 原始分 5 分不一定代表更高水平——可能是反向题
- -99 不一定真的是 -99 分——可能代表"未回答"的特定标记数字
清洗顺序:
- 先读问卷和量表说明
- 确认合法范围、缺失编码和反向题
- 查看重复编号、越界值和异常作答
- 最后计算反向分和总分
财务管理数据
财务面板不能只看一列是否重复:
- 公司代码可以重复(同一家公司有很多年度)
- 年度可以重复(同一年有很多家公司)
- 唯一标识应是公司代码 + 会计年度
单位问题:可能存在元、万元、百万元的不同单位,不统一单位时程序不会报错,但金额可能差 1 万倍。
特殊值含义:
- 研发投入为 0 ≠ 未披露——0 可能是明确披露为零
- 研发投入为 -999 表示未披露——两个值不能合并成同一个 0
- 极端净利润应先看事件说明,不能一律缩尾
访谈文本数据
访谈文本没有固定数值范围,但有说话人、段落顺序、语境和身份风险:
- 姓名和电话是直接标识符
- "某县唯一一名从事某种稀缺职业的女性"属于间接标识符组合
- 文本中连续出现两次完全相同的段落可做技术性重复处理
- 但受访者说"编号不能丢,编号不能丢"可能是在强调意义,不能机械删除
质性清洗的核心:不是把文字变整齐,而是在不破坏语义的前提下提高可用性,并保护参与者隐私。
工科持续信号数据
时续信号最大的专业特征是顺序:
- 100 赫兹采样 → 相邻时间戳大约差 10 毫秒
- 出现两个相同时间戳 → 可能是重传
- 间隔突然变大 → 可能是丢包
- 时间戳倒退 → 可能是乱序或设备时钟问题
信号值不能先做批量处理:
- 超过传感器量程的值可能是饱和
- 非常大的值可能在量程内且是一次真实的冲击
- 直接用移动平均平滑可能把设备故障最关键的瞬态证据删除
时续信号的清洗顺序:检查数据包和时间轴 → 统一单位 → 识别缺失和量程问题 → 保留质量标记 → 最后根据分析目的决定是否重采样、差值或滤波。
跨专业数据的共同清洗主线
不同专业不能共用同一套清洗规则,但可以共享同一条清洗主线。整体思路流程一致,具体操作因对象不同而变化。
共同原则(不管什么专业、领域都大概率需要执行):
- 先知道数据怎么来的(来源与生成机制)
- 再知道规则从哪来(依据量表的说明、会计口径、访谈规则等)
- 先报告问题再执行处理
- 最后回到原始材料进行验证
变量命名与字典要求
变量命名和字典需体现专业结构性。表中应包含:变量名、含义、约束、处理事例。
关键要求:
- 变量名需与对应对象/功能文件对应
- 区分原始数据与清洗后数据(在变量名上体现)
- 便于在复杂流程中快速了解当前数据的状态和属性
量化线演示:问卷数据清洗
演示目标
完整演示从数据体检 → 规则确认 → 脚本执行 → 结果验证与记录说明的闭环。
第一步:查看原始文件和变量说明
原始问卷数据包含受访者编号、时间、年龄、专业以及七道题目(每题有一个得分)。
第二步:输出数据体检报告
让 AI 读取数据后输出全面体检报告,包含:
- 结构检测(如 300 行数据、各列类型和内容类型)
- 重复字段检测
- 缺失值检测(含缺失编码)
- 极端值/极大值检测
- 字段类型的合理建议
- 清洗规则建议(对超界值标记或设为缺失值等)
第三步:定义清洗规则
规则定义表示例:
| 项目 | 规则 |
|---|---|
| 特殊编码 -99、999 | 表示未回答 |
| 合法边界 | 1 到 5 之间 |
| 超界值(如 8) | 直接设置为缺失值 |
| 反向题 Q03、Q06 | 数值越大反而是越反向的结果 |
重要提醒:这些规则不是 AI 自己"想出来"的,需要学生自己把研究方案、量表说明、采集设计和质量控制标准提供给 AI。AI 不清楚具体课题的真实情况。
第四步:生成并运行清洗脚本
AI 生成 Python 脚本,脚本中将关键值说明设置为指令。不需要每位同学会从零写 Python 代码,但至少需要能看懂:
- 脚本读了哪个文件
- 哪些值会被认定为缺失值
- 哪些变量会被改名或计算
- 哪些记录会被标记
- 结果输出到哪个文件夹、哪个位置
运行后生成的文件:
- 清理后的数据文件:异常值被设置为空值(如 8 对应为空值)
- 异常标记筛选文件(flag 文件):将处理中检测到的异常单独标出(如 -99、99、8 等不符合规则或非常特别的数据案例)
- 清洗报告:列出规则、存在的问题、未解决的问题和建议
演示中发现的注意事项
- 数据列名是中文,而提示词写的是英文字段名,AI 需要自行对应转换。建议学生提前把列名修改好再交给 AI,可省去中间步骤。
质性线演示:访谈文本清洗
质性清洗的边界
质性材料与问卷数据的质性有很大区别:很多看起来不准确的内容本身就是研究意义的一部分。
- 停顿、重复、口头语、犹豫、情绪变化
- 在某些研究中可能是噪声,在另一些(如绘画分析、叙事研究、口述史研究)中却是重要证据
质性清洗不能先套用一个统一的规则,要先问:我的分析方法需要保留什么?
质性文本处理的三类动作
- 格式整理:统一编码转换
- 脱敏:去除访谈人的关键隐私信息
- 去重与分词:判断哪些重复是有意义的,哪些是无用的
直接标识符与间接标识符
| 类型 | 定义 | 示例 |
|---|---|---|
| 直接标识符 | 容易发现 | 姓名、手机号、身份证号 |
| 间接标识符 | 难以发现 | 某县唯一一位三岁的女法医(地区+年龄+性别+罕见职业组合仍可锁定具体的人) |
质性脱敏要看组合的风险,不能只做关键词替换。推荐占位符方案:人名用 person1、person2……单位用 org1、org2……时间做统一替换。
处理规则制定
对访谈文本的处理规则包括:
- 确定文件编码和可读性
- 保留访谈编号、段落编号、说话人标签
- 对关键信息(年龄、姓名、地区)做隐藏或转换为编码
- 导出/识别重复段落
- 识别口头语、重复表达,根据语气信息进一步处理
数据安全提醒
处理具有隐私性、安全性的访谈材料时应在本地处理,不要上传到网络服务或网页端处理,否则可能泄露受访人数据信息。
清洗结果示例
脱敏后对比展示:人名、地点均被替换。但自动替换完成后仍需研究者结合研究场景判断——例如"当地唯一带竞赛班的教师"本身可能是间接标识,需要判断是保留研究意义还是进一步泛化为"承担特殊教学任务的教师"。
总结:脱敏不是单纯替换姓名和地点就结束,而是在保护隐私和研究价值之间做有依据的平衡。
四个专业案例与完整提示词
案例一:心理学问卷数据
- 输入:心理学问卷数据文件(已提供)
- 处理:从数据检测 → 背景交代 → 原则规则确定 → 具体清洗操作
- 输出:检测报告、清洗后数据、标记文件、清洗报告等多个文件
案例二:财务管理数据
- 输入:财务数据 + 对应说明文件
- 说明文件包含:变量、每个变量的类型、合法值判别标准
- 清洗要求:需自己针对数据设定要求后发送给 AI
案例三:访谈文本数据
- 输入:12 个文本的访谈数据 + 说明文件
- 专业要点已在讲解部分覆盖
- 提供完整提示词供学生自行实验
案例四:工科持续信号数据
- 输入:原始数据 + 说明文件
- 清洗规则在提示词中体现
- 输出多个结果文件
课后练习题与答案
题一:财务数据中的研发投入为 -99 表示未披露,研发成本等于 0 表示明确为零。正确做法?
- 答案:C——分别编码并保留原因,方便后续复盘
题二:同一列中同时出现了元、万元和百万元,最先应完成哪一步?
- 答案:B——统一单位并记录换算
题三:访谈文本中出现连续重复表达时,最合适的处理方式?
- 答案:C——区分是技术性重复还是语义上的重复,对应不同操作
题四(多选):下列哪些事项不能完全交给 AI 自动决定?
- 答案:ABC
- 反向题的规则规定需要给 AI 预设
- 极端处理的规则需要给 AI 预设
- 边界值需要给 AI 预设
本讲总结
核心认识
- 综述写作不是把多篇摘要连接起来,而是比较证据并组织论证引用
- 引用真实 ≠ 论点成立,必须真实的证据与论点对应
- 数据清洗不是删除不整齐的记录,而是依据量表说明、会计口径、访谈规则等特定数据类型的规则,建立可复现的分析输入
课程完整路径回顾
- 文献部分:以模块三文献矩阵为基础 → 通过建立引用证据链 → 保证文献合理且有支撑
- 数据部分:针对心理学问卷、财务数据、访谈文本、工科时续信号四套数据 → 从读数据 → 制定清洗规则 → 生成清洗脚本 → 完成清洗输出结果进行检查(完整流程闭环)
下一节课预告
将使用本节课形成的清洗后的数据和数据处理说明,进入:
- 数据分析、科研绘图与论文初稿课程
- 量化研究:统计分析 → 检验 → 模型分析的基本路径
- 质性研究:主题编码、归纳比较、语文整理
- 使用科研可视化 skill 生成可追溯的科研图表
- 针对方法、结论和讨论三大主部分的初步初稿写作任务