海量舆情数据看不过来怎么办?舆情抽样怎样抽才科学不失真
围绕海量舆情信息的处理,舆情抽样通常指从特定时段、特定平台与特定议题所生成的网络公开信息中,按照事先设定的规则抽取一部分内容作为样本,用以估计整体舆论的规模、结构、情绪倾向与议题走向;其内涵主要涉及总体与样本框的界定、抽样单位与抽样方法的选择、偏差控制,以及结论可推广范围的说明等方面。当数据量远超人工阅读与常规分析所能承载的限度时,全量通读在时效、成本与判断一致性上都面临明显约束,抽样由此成为舆情工作中较为常见的一种认识路径。抽样本身并不自动带来可靠的结论,其效果取决于规则是否透明、样本对总体的代表性是否经过检验、以及由此形成的判断在何种范围内成立。
舆情数据为什么难以全量消化?
在网络平台持续生成内容的环境中,舆情数据的增长速度往往超过人工阅读与分析能力的扩张速度,单日产生的帖文、评论与转发在数量上便已构成较大压力;与此同时,这些内容中夹杂着大量重复转发、营销推广与自动账号发布的信息,其信息增量相对有限,却占用相当比例的阅读与处理时间。从时效角度来看,全量收集与清洗本身需要时间,等到材料整理完毕,议题的热度分布与情绪倾向可能已经发生变化,研判所依据的状态与公众当下的感受之间由此出现落差。另外,平台接口的开放程度、数据获取权限以及个人信息保护方面的要求,也使得面向全部数据的采集与处理在很多情形下并不具备现实条件。
舆情抽样有哪些常见方式?
传播学研究通常把资料收集区分为定量与定性两类路径,前者多采用概率抽样,其结果在理论上可以推广到总体;后者多采用非概率抽样,更关注个案、情境与意义的呈现。舆情实践中的抽样方式大体沿这两条线索展开。
| 类别 | 常见形式 | 主要特点 | 需要注意的局限 |
|---|---|---|---|
| 概率抽样 | 简单随机抽样 | 总体中每个单位被抽中的机会相等 | 需要完整可用的样本框 |
| 概率抽样 | 系统抽样 | 按固定间隔从序列中抽取 | 序列存在周期性时容易产生偏差 |
| 概率抽样 | 分层抽样 | 按平台、地域、账号类型分层后再抽 | 分层依据是否与议题结构一致 |
| 概率抽样 | 整群与多阶段抽样 | 先抽群组,再从群组内部抽取 | 群内同质性较易造成误差累积 |
| 非概率抽样 | 配额抽样 | 按预设比例分配名额 | 比例设定带有主观判断 |
| 非概率抽样 | 目的性抽样 | 依据研究目标选取典型样本 | 结果难以推广到总体 |
| 非概率抽样 | 便利抽样 | 取用易于获得的内容 | 代表性最弱,容易偏向活跃账号 |
| 非概率抽样 | 滚雪球抽样 | 由已有样本引出新样本 | 样本分布趋于同质 |
在舆情监测场景中,分层与多阶段抽样的组合使用较为普遍,其做法是先按平台、议题或时间片划分层次,再在各层内独立抽取,从而使样本在结构上更接近总体的构成;非概率抽样的方式多用于议题初期的探索性了解,或用于对特定群体表达的理解,其结论一般不宜直接用于推断总体比例。
哪些环节容易让抽样结果失真?
失真往往来自抽样之前与抽样之后的多个环节,而非某一方法的选择。首先是样本框问题,只用单一平台的数据、只抓取热门话题、只保留可见的搜索结果,都会使总体在界定阶段就已被缩小,此后的抽取即便规范,反映的也只是这个被缩小后的总体。其次是关键词与规则设定,过窄的关键词会漏掉使用不同表述的讨论,过宽的关键词又会引入大量与议题无关的内容,两种情形都会改变样本的构成比例。再者是时间窗口的截断,议题发展通常经历上升、高峰与回落,若抽样时间集中在某一阶段,所得的情绪分布与议题结构会明显偏向该阶段的状态。另外,重复内容与自动账号的处理也不容忽视,大量转发与机器发布的信息在计数上会放大某一声音的权重,若不做去重与账号甄别,样本的比例结构便会偏离真实表达分布。除此之外,编码与判断环节同样构成偏差来源,同一条文本由不同人员处理时可能出现不同归类,定量取向的研究通常把信度与可重复性作为衡量标准,编码规则模糊、复核缺失的情形下,样本偏差还会叠加人工判断的偏差。由此可以看出,抽样的失真常常是总体界定、规则设定与执行复核共同作用的结果,单靠扩大样本量难以消除。
抽样结果怎样与研判衔接?
总体与抽样单位的界定需要先行写明,包括平台范围、时间区间与内容类型;抽样方法、分层依据与实际样本量应当记录在案,便于他人复核与重复。样本中的重复内容、营销内容与自动账号发布的信息需经过识别与合并,编码口径应事先统一,并在完成后进行抽样复核。结论的表述需要标明适用范围,概率抽样的结果可以在相应误差条件下推断总体分布,非概率抽样的结果通常只用于描述样本所覆盖的表达。涉及网络公开信息采集与使用时,还需遵守我国在网络信息内容管理方面的规范要求,《中华人民共和国网络安全法》(全国人民代表大会常务委员会通过)与《网络信息内容生态治理规定》(国家互联网信息办公室发布)等文件对信息内容的采集、使用与相关责任作出了相应规定。
总结
从整体来看,舆情抽样所处理的问题,是在数据规模、处理时效与资源条件之间寻找一种可以说明的判断方式。抽样方法的科学性,既依赖概率抽样所要求的随机性与结构匹配,也依赖非概率抽样所强调的目标针对性与情境理解;其结果是否失真,则更多取决于总体界定是否清晰、规则设定是否稳定、执行过程是否可复核。在样本结构与总体结构较为接近、编码口径较为统一、结论范围标注较为明确的情形下,抽样结果对舆论态势的反映具有参考价值;反之,当样本框明显偏窄或时间窗口严重偏向某一阶段时,即便样本量较大,结论仍可能偏离实际情况。
FAQ
全量数据难以获取时,抽样结论还能支撑研判吗?
概率抽样的结果在样本框完整、抽取过程随机的前提下,可以在一定误差范围内推断总体分布;样本框本身不完整时,结论的适用范围也随之缩小。这类情形下,抽样结果更适合用于描述所覆盖范围内的结构特征,并与其他来源的材料相互参照。
样本量越大,抽样结果是否越可靠?
样本量的增加可以在一定程度上降低随机误差,但对样本框偏差、关键词偏差与重复内容造成的比例失真并无直接改善作用。当抽样规则本身偏向某一平台或某一阶段的表达时,样本量扩大往往只是把既有偏差按更大规模复制一遍。
舆情抽样需要留存哪些记录?
通常包括总体的界定范围、抽样框的来源与获取时间、抽样方法与分层依据、实际样本量、去重与账号甄别的规则、编码口径与复核结果,以及结论的适用限度。这些记录既服务于后续复核,也便于在不同时间点对同一议题进行对照。