返回
查看原链接原链接
Bilibili1小时0分35秒 · —

文献综述写作与数据准备清洗 · 第四讲

第四讲:文献综合写作与数据准备清洗

文献综述的关键在于证据关系是否成立,而非句子是否好看;数据清洗的关键在于依据专业规则进行可复现的整理,而非简单删除不整齐的记录。

课程定位与课前准备

课程背景

上一讲已完成了文献矩阵(轮零显零散的文献整理)并从矩阵中找到研究空白、确定主选题。本讲解决两个核心问题:文献证据链的搭建与核验,以及数据证据链的建立与清洗

课程讲授的七个讲解内容覆盖:

  1. 文献矩阵到综述提纲的转换
  2. 引用与证据链的核验
  3. 数据清洗的原则与方法
  4. 量化数据(问卷)清洗演示
  5. 质性数据(访谈)清洗演示
  6. 多专业案例讲解(心理学问卷、财务面板、访谈文本、工科时续信号)
  7. 课后练习与总结

课前准备要求

  • 完成上一讲(模块三)中的文献阅读矩阵
  • 确定好自己的主选题和研究问题
  • 准备好待处理的数据

两个课前关键问题及其回答

问题一:已有十篇文献摘要,是否可以直接让 AI 写综述?

答案是否定的。原因:摘要不一定包含研究方法、局限等信息,直接写综述容易产生过度概括(即把摘要中的信息当作完整结论来使用)。

问题二:数据里有特别大的值,删掉就干净了吗?

这种表达有问题。原因:特别大的值可能是录入错误,也可能是真实的极端案例。正确做法是先核对来源并标记,不能只凭大小删除

本课程同时处理两条证据链:

  • 文献证据链:涉及文献真实性与论点支持度
  • 数据证据链:涉及数据来源、规则与清洗流程

从文献矩阵到综述结构设计

不推荐的写法:堆沙式综述

常见错误写法示例:

  • 张三研究了什么
  • 李四研究了什么
  • 王五研究了什么

这种写法的特点与危害:

  • 每篇文献单独看都没有错
  • 但读者读完后看不出研究之间的关系
  • 每篇文献就像一粒沙子,数量虽多但没有组织成结构
  • 结构上表现为 2.1、2.2、2.3 各自罗列某人做了某事

推荐的结构:主题聚类式综述

真正需要的不是把文献名单报一遍,而是告诉读者:

  • 该领域形成了哪些主要认识
  • 在哪里出现了分歧
  • 分歧可能来自什么对象、数据和方法
  • 现有证据还留下了什么问题

推荐的一篇综述文章段落结构

  1. 核心概念出发 → 概念定义与边界界定
  2. 深入讲解背后影响机制
  3. 介绍学者们的方法分类
  4. 总结不足、方法目前的边界与未来方向

从文献矩阵中寻找聚类依据

主题聚类不能由 AI 根据标题随便分组,需回到文献矩阵中观察哪些列能真正回答研究问题。不同研究问题对应不同的聚类维度:

研究问题关注点聚类维度建议
为什么(机制问题)按理论机制或中介路径聚类
对谁有效(异质性)按研究对象聚类
结论矛盾按情境、时间、样本和方法聚类
质性研究按核心概念、叙事模式或解释框架聚类

写出"综合感"的四步结构

分完主题后为防止一个主题下面变成文献罗列,使用共识、分歧、证据评价、研究缺口四步结构:

  1. 共识:先把这一组研究形成的共同认识写出来
  2. 分歧:说明他们在结论、对象或解释上不同
  3. 证据评价:分析分歧是否可能源于研究设计、样本测量或情境差异
  4. 研究缺口:自然引出仍需回答的问题

示范:短视频使用与青少年注意力

假设三篇研究发现高频使用与注意力困难相关,其中两篇是横截面问卷、一篇是短期实验,不能直接写成"短视频导致注意力下降"。更稳妥的表达方式:

现有研究普遍观察到二者之间存在关联,但因为多数证据来自横截面自陈述数据,因果方向仍不明确;短期实验提示即时干扰效应存在,但能否延伸到长期认知变化仍需进一步研究。

这段写法没有逐篇报名字,但每个判断都来自文献矩阵中的文献,且把证据强度和研究边界说明清楚。

用 AI 生成提纲的提示词与三项检查

课程演示了向 Codex 发送生成提纲的提示词(输入此前建立的文献矩阵文件)。提纲输出后不能只看标题是否漂亮,需要做三项检查

  1. 每一个主题是否真的由文献支持
  2. 同一篇文献放进这个主题的理由是什么
  3. 这些主题能否共同回答研究问题

如果一个标题只是在重复题目的关键词,或一个主题下面只有一篇文献,需要继续合并、拆分或补充证据。主题分类是研究者的解释工作,不是机器自动聚类后就结束的。


引用与证据链的核验

三层引用核验

很多同学认为查到 DOI、论文真实就等于引用正确。这仅完成了第一层。引用核验至少包含三个层次:

层数核验内容说明
第一层存在性论文是否真实存在
第二层身份一致性引用情况的论文题目、作者、期刊号是否完全一致
第三层语义支持度原文论点是否能完全支撑引用处的表述,支持到什么程度

AI 幻觉的常见形式

AI 生成的幻觉性引用不一定是完全不存在的文献,更常见的是真文献配错观点——找到的是题目相关的文章,然后把希望得到的结果安在该论文身上。

因此,核验单位不是参考文献条目,而是论文中的一条具体论点。每条重要论点都要能回溯到原文中的具体位置。

论点-证据核验表的建立

完整的核验表应包含以下字段:

  • 论文编号
  • 论点(你写的论点内容)
  • 引用的文献来源
  • 文献真实性(作者、期刊号等信息核对)
  • 原文数据(对应期刊论文中论点的具体位置)
  • 支持程度(最重要的字段)

支持程度的四个等级:

  1. 完全支持:原文直接支持当前表述
  2. 部分支持:方向接近,但具体对象、方法、时间上存在差异
  3. 不支持:原文根本没有该结论,是强行把论点安在论文上
  4. 无法判断:仅凭摘要或部分信息,找不到原文论点

部分支持情况下的正确处理:不是简单把文献扔掉,而是缩小表述范围。例如:

  • 原文只研究了某一所高校的学生,不能写成青少年普遍如此
  • 原文报告的是相关关系,不能改成"导致"
  • 原文说"可能与什么相关",不能改成"证明了一种机制"

生成核验表的操作流程

第一步:生成论点草稿。通过提示词让 AI 读取文献矩阵和文献大纲,输出初步论点草稿(包含编号、章节、论点、对应文献等字段)。

第二步:对论点进行三层核验。将论点草稿(部分论点)连同文献矩阵、原始 PDF、原数据文件发给 AI,输出核验证据链表。核验内容包括:文献真实性、编号、信息一致性、原文是否支持观点(AI 直接读取原文件,找到支撑论点的具体位置并标注支持程度)。

课程演示结果:前三个论点中,两个为完全支持,一个为部分支持。部分支持的需要适当缩小表述范围,AI 会给出原因和处理建议。

文献管理软件的使用提醒

Word 中尽量使用文献管理软件(前几讲中涉及的)的添加编辑景分功能,使正文引用与文末参考文献保持联动。当原数据有误时在软件中修正后刷新,文档即自动更新。

引用核验判断题

题号题目答案
1DOI 能正常打开,这篇文献一定支持我的论点吗?错误
2原文研究成年人,句中写大学生,算完整支持吗?错误
3原文只报告相关关系,综述应避免改写为因果关系正确
4只有摘要时,可以标记"无法判断",等待全文核验正确

补充:文献原数据的导出

核验提示词需要文献的原数据文件。具体操作方法:在文献管理软件中点击每个文献 → 右键 → 导出条目 → 选择 CSL JSON 文件格式。导出的是带摘要的文献原数据,补充该文件后可正常输出证据链核验表。


跨专业数据特征与共同原则

数据的"一行代表什么"问题

数据不只是 Excel 里的数字。不同领域中数据的行含义不同:

  • 问卷数据:一行可能是一位受访者
  • 财务面板数据:一行可能是一家公司在某一年度的记录
  • 访谈数据:一行可能是一个说话轮次
  • 时续信号:一行则可能是某一个采样时刻

如果连一行代表什么都没搞清楚,就无法判断什么是重复、缺失或异常。

四套教学数据

课程提供四套虚构(虚拟)教学数据,存放在工作区文件夹中:

  1. 心理学问卷数据:受访者编号 + 各题目的得分
  2. 财务面板数据:公司收入、资产、人员等金融领域记录
  3. 访谈记录:一来一回的问答构成,共 12 条
  4. 工科持续震动信号传感器采样数据:包含很多传感器采集的信号

为什么四种数据不能使用同一套清洗规则

问卷数据

问卷数字通常是有方向、有范围的测量编码。典型问题:

  • 原始分 5 分不一定代表更高水平——可能是反向题
  • -99 不一定真的是 -99 分——可能代表"未回答"的特定标记数字

清洗顺序

  1. 先读问卷和量表说明
  2. 确认合法范围、缺失编码和反向题
  3. 查看重复编号、越界值和异常作答
  4. 最后计算反向分和总分
财务管理数据

财务面板不能只看一列是否重复:

  • 公司代码可以重复(同一家公司有很多年度)
  • 年度可以重复(同一年有很多家公司)
  • 唯一标识应是公司代码 + 会计年度

单位问题:可能存在元、万元、百万元的不同单位,不统一单位时程序不会报错,但金额可能差 1 万倍。

特殊值含义:

  • 研发投入为 0 ≠ 未披露——0 可能是明确披露为零
  • 研发投入为 -999 表示未披露——两个值不能合并成同一个 0
  • 极端净利润应先看事件说明,不能一律缩尾
访谈文本数据

访谈文本没有固定数值范围,但有说话人、段落顺序、语境和身份风险:

  • 姓名和电话是直接标识符
  • "某县唯一一名从事某种稀缺职业的女性"属于间接标识符组合
  • 文本中连续出现两次完全相同的段落可做技术性重复处理
  • 但受访者说"编号不能丢,编号不能丢"可能是在强调意义,不能机械删除

质性清洗的核心:不是把文字变整齐,而是在不破坏语义的前提下提高可用性,并保护参与者隐私

工科持续信号数据

时续信号最大的专业特征是顺序

  • 100 赫兹采样 → 相邻时间戳大约差 10 毫秒
  • 出现两个相同时间戳 → 可能是重传
  • 间隔突然变大 → 可能是丢包
  • 时间戳倒退 → 可能是乱序或设备时钟问题

信号值不能先做批量处理:

  • 超过传感器量程的值可能是饱和
  • 非常大的值可能在量程内且是一次真实的冲击
  • 直接用移动平均平滑可能把设备故障最关键的瞬态证据删除

时续信号的清洗顺序:检查数据包和时间轴 → 统一单位 → 识别缺失和量程问题 → 保留质量标记 → 最后根据分析目的决定是否重采样、差值或滤波。

跨专业数据的共同清洗主线

不同专业不能共用同一套清洗规则,但可以共享同一条清洗主线。整体思路流程一致,具体操作因对象不同而变化。

共同原则(不管什么专业、领域都大概率需要执行):

  1. 先知道数据怎么来的(来源与生成机制)
  2. 再知道规则从哪来(依据量表的说明、会计口径、访谈规则等)
  3. 先报告问题再执行处理
  4. 最后回到原始材料进行验证

变量命名与字典要求

变量命名和字典需体现专业结构性。表中应包含:变量名、含义、约束、处理事例。

关键要求:

  • 变量名需与对应对象/功能文件对应
  • 区分原始数据与清洗后数据(在变量名上体现)
  • 便于在复杂流程中快速了解当前数据的状态和属性

量化线演示:问卷数据清洗

演示目标

完整演示从数据体检 → 规则确认 → 脚本执行 → 结果验证与记录说明的闭环。

第一步:查看原始文件和变量说明

原始问卷数据包含受访者编号、时间、年龄、专业以及七道题目(每题有一个得分)。

第二步:输出数据体检报告

让 AI 读取数据后输出全面体检报告,包含:

  • 结构检测(如 300 行数据、各列类型和内容类型)
  • 重复字段检测
  • 缺失值检测(含缺失编码)
  • 极端值/极大值检测
  • 字段类型的合理建议
  • 清洗规则建议(对超界值标记或设为缺失值等)

第三步:定义清洗规则

规则定义表示例:

项目规则
特殊编码 -99、999表示未回答
合法边界1 到 5 之间
超界值(如 8)直接设置为缺失值
反向题 Q03、Q06数值越大反而是越反向的结果

重要提醒:这些规则不是 AI 自己"想出来"的,需要学生自己把研究方案、量表说明、采集设计和质量控制标准提供给 AI。AI 不清楚具体课题的真实情况。

第四步:生成并运行清洗脚本

AI 生成 Python 脚本,脚本中将关键值说明设置为指令。不需要每位同学会从零写 Python 代码,但至少需要能看懂:

  • 脚本读了哪个文件
  • 哪些值会被认定为缺失值
  • 哪些变量会被改名或计算
  • 哪些记录会被标记
  • 结果输出到哪个文件夹、哪个位置

运行后生成的文件:

  1. 清理后的数据文件:异常值被设置为空值(如 8 对应为空值)
  2. 异常标记筛选文件(flag 文件):将处理中检测到的异常单独标出(如 -99、99、8 等不符合规则或非常特别的数据案例)
  3. 清洗报告:列出规则、存在的问题、未解决的问题和建议

演示中发现的注意事项

  • 数据列名是中文,而提示词写的是英文字段名,AI 需要自行对应转换。建议学生提前把列名修改好再交给 AI,可省去中间步骤。

质性线演示:访谈文本清洗

质性清洗的边界

质性材料与问卷数据的质性有很大区别:很多看起来不准确的内容本身就是研究意义的一部分

  • 停顿、重复、口头语、犹豫、情绪变化
  • 在某些研究中可能是噪声,在另一些(如绘画分析、叙事研究、口述史研究)中却是重要证据

质性清洗不能先套用一个统一的规则,要先问:我的分析方法需要保留什么?

质性文本处理的三类动作

  1. 格式整理:统一编码转换
  2. 脱敏:去除访谈人的关键隐私信息
  3. 去重与分词:判断哪些重复是有意义的,哪些是无用的

直接标识符与间接标识符

类型定义示例
直接标识符容易发现姓名、手机号、身份证号
间接标识符难以发现某县唯一一位三岁的女法医(地区+年龄+性别+罕见职业组合仍可锁定具体的人)

质性脱敏要看组合的风险,不能只做关键词替换。推荐占位符方案:人名用 person1person2……单位用 org1org2……时间做统一替换。

处理规则制定

对访谈文本的处理规则包括:

  1. 确定文件编码和可读性
  2. 保留访谈编号、段落编号、说话人标签
  3. 对关键信息(年龄、姓名、地区)做隐藏或转换为编码
  4. 导出/识别重复段落
  5. 识别口头语、重复表达,根据语气信息进一步处理

数据安全提醒

处理具有隐私性、安全性的访谈材料时应在本地处理,不要上传到网络服务或网页端处理,否则可能泄露受访人数据信息。

清洗结果示例

脱敏后对比展示:人名、地点均被替换。但自动替换完成后仍需研究者结合研究场景判断——例如"当地唯一带竞赛班的教师"本身可能是间接标识,需要判断是保留研究意义还是进一步泛化为"承担特殊教学任务的教师"。

总结:脱敏不是单纯替换姓名和地点就结束,而是在保护隐私和研究价值之间做有依据的平衡。


四个专业案例与完整提示词

案例一:心理学问卷数据

  • 输入:心理学问卷数据文件(已提供)
  • 处理:从数据检测 → 背景交代 → 原则规则确定 → 具体清洗操作
  • 输出:检测报告、清洗后数据、标记文件、清洗报告等多个文件

案例二:财务管理数据

  • 输入:财务数据 + 对应说明文件
  • 说明文件包含:变量、每个变量的类型、合法值判别标准
  • 清洗要求:需自己针对数据设定要求后发送给 AI

案例三:访谈文本数据

  • 输入:12 个文本的访谈数据 + 说明文件
  • 专业要点已在讲解部分覆盖
  • 提供完整提示词供学生自行实验

案例四:工科持续信号数据

  • 输入:原始数据 + 说明文件
  • 清洗规则在提示词中体现
  • 输出多个结果文件

课后练习题与答案

题一:财务数据中的研发投入为 -99 表示未披露,研发成本等于 0 表示明确为零。正确做法?

  • 答案:C——分别编码并保留原因,方便后续复盘

题二:同一列中同时出现了元、万元和百万元,最先应完成哪一步?

  • 答案:B——统一单位并记录换算

题三:访谈文本中出现连续重复表达时,最合适的处理方式?

  • 答案:C——区分是技术性重复还是语义上的重复,对应不同操作

题四(多选):下列哪些事项不能完全交给 AI 自动决定?

  • 答案:ABC
  • 反向题的规则规定需要给 AI 预设
  • 极端处理的规则需要给 AI 预设
  • 边界值需要给 AI 预设

本讲总结

核心认识

  1. 综述写作不是把多篇摘要连接起来,而是比较证据并组织论证引用
  2. 引用真实 ≠ 论点成立,必须真实的证据与论点对应
  3. 数据清洗不是删除不整齐的记录,而是依据量表说明、会计口径、访谈规则等特定数据类型的规则,建立可复现的分析输入

课程完整路径回顾

  • 文献部分:以模块三文献矩阵为基础 → 通过建立引用证据链 → 保证文献合理且有支撑
  • 数据部分:针对心理学问卷、财务数据、访谈文本、工科时续信号四套数据 → 从读数据 → 制定清洗规则 → 生成清洗脚本 → 完成清洗输出结果进行检查(完整流程闭环)

下一节课预告

将使用本节课形成的清洗后的数据和数据处理说明,进入:

  • 数据分析、科研绘图与论文初稿课程
  • 量化研究:统计分析 → 检验 → 模型分析的基本路径
  • 质性研究:主题编码、归纳比较、语文整理
  • 使用科研可视化 skill 生成可追溯的科研图表
  • 针对方法、结论和讨论三大主部分的初步初稿写作任务