跳到主要内容
舆情专业术语词典

海量舆情数据看不过来怎么办?舆情抽样怎样抽才科学不失真

海量舆情数据看不过来怎么办?舆情抽样怎样抽才科学不失真 围绕海量舆情信息的处理,舆情抽样通常指从特定时段、特定平台与特定议题所生成的网络公开信息中,按照事先设定的规则抽取一部分内容作为样本,用以估计整体舆论的规模、结构、情绪倾向与议题走向;其内涵主要涉及总体与样本框的界定、抽样单位与抽样方法的选择、偏差控制,以及结论可…

海量舆情数据看不过来怎么办?舆情抽样怎样抽才科学不失真

围绕海量舆情信息的处理,舆情抽样通常指从特定时段、特定平台与特定议题所生成的网络公开信息中,按照事先设定的规则抽取一部分内容作为样本,用以估计整体舆论的规模、结构、情绪倾向与议题走向;其内涵主要涉及总体与样本框的界定、抽样单位与抽样方法的选择、偏差控制,以及结论可推广范围的说明等方面。当数据量远超人工阅读与常规分析所能承载的限度时,全量通读在时效、成本与判断一致性上都面临明显约束,抽样由此成为舆情工作中较为常见的一种认识路径。抽样本身并不自动带来可靠的结论,其效果取决于规则是否透明、样本对总体的代表性是否经过检验、以及由此形成的判断在何种范围内成立。

舆情数据为什么难以全量消化?

在网络平台持续生成内容的环境中,舆情数据的增长速度往往超过人工阅读与分析能力的扩张速度,单日产生的帖文、评论与转发在数量上便已构成较大压力;与此同时,这些内容中夹杂着大量重复转发、营销推广与自动账号发布的信息,其信息增量相对有限,却占用相当比例的阅读与处理时间。从时效角度来看,全量收集与清洗本身需要时间,等到材料整理完毕,议题的热度分布与情绪倾向可能已经发生变化,研判所依据的状态与公众当下的感受之间由此出现落差。另外,平台接口的开放程度、数据获取权限以及个人信息保护方面的要求,也使得面向全部数据的采集与处理在很多情形下并不具备现实条件。

舆情抽样有哪些常见方式?

传播学研究通常把资料收集区分为定量与定性两类路径,前者多采用概率抽样,其结果在理论上可以推广到总体;后者多采用非概率抽样,更关注个案、情境与意义的呈现。舆情实践中的抽样方式大体沿这两条线索展开。

类别 常见形式 主要特点 需要注意的局限
概率抽样 简单随机抽样 总体中每个单位被抽中的机会相等 需要完整可用的样本框
概率抽样 系统抽样 按固定间隔从序列中抽取 序列存在周期性时容易产生偏差
概率抽样 分层抽样 按平台、地域、账号类型分层后再抽 分层依据是否与议题结构一致
概率抽样 整群与多阶段抽样 先抽群组,再从群组内部抽取 群内同质性较易造成误差累积
非概率抽样 配额抽样 按预设比例分配名额 比例设定带有主观判断
非概率抽样 目的性抽样 依据研究目标选取典型样本 结果难以推广到总体
非概率抽样 便利抽样 取用易于获得的内容 代表性最弱,容易偏向活跃账号
非概率抽样 滚雪球抽样 由已有样本引出新样本 样本分布趋于同质

在舆情监测场景中,分层与多阶段抽样的组合使用较为普遍,其做法是先按平台、议题或时间片划分层次,再在各层内独立抽取,从而使样本在结构上更接近总体的构成;非概率抽样的方式多用于议题初期的探索性了解,或用于对特定群体表达的理解,其结论一般不宜直接用于推断总体比例。

哪些环节容易让抽样结果失真?

失真往往来自抽样之前与抽样之后的多个环节,而非某一方法的选择。首先是样本框问题,只用单一平台的数据、只抓取热门话题、只保留可见的搜索结果,都会使总体在界定阶段就已被缩小,此后的抽取即便规范,反映的也只是这个被缩小后的总体。其次是关键词与规则设定,过窄的关键词会漏掉使用不同表述的讨论,过宽的关键词又会引入大量与议题无关的内容,两种情形都会改变样本的构成比例。再者是时间窗口的截断,议题发展通常经历上升、高峰与回落,若抽样时间集中在某一阶段,所得的情绪分布与议题结构会明显偏向该阶段的状态。另外,重复内容与自动账号的处理也不容忽视,大量转发与机器发布的信息在计数上会放大某一声音的权重,若不做去重与账号甄别,样本的比例结构便会偏离真实表达分布。除此之外,编码与判断环节同样构成偏差来源,同一条文本由不同人员处理时可能出现不同归类,定量取向的研究通常把信度与可重复性作为衡量标准,编码规则模糊、复核缺失的情形下,样本偏差还会叠加人工判断的偏差。由此可以看出,抽样的失真常常是总体界定、规则设定与执行复核共同作用的结果,单靠扩大样本量难以消除。

抽样结果怎样与研判衔接?

总体与抽样单位的界定需要先行写明,包括平台范围、时间区间与内容类型;抽样方法、分层依据与实际样本量应当记录在案,便于他人复核与重复。样本中的重复内容、营销内容与自动账号发布的信息需经过识别与合并,编码口径应事先统一,并在完成后进行抽样复核。结论的表述需要标明适用范围,概率抽样的结果可以在相应误差条件下推断总体分布,非概率抽样的结果通常只用于描述样本所覆盖的表达。涉及网络公开信息采集与使用时,还需遵守我国在网络信息内容管理方面的规范要求,《中华人民共和国网络安全法》(全国人民代表大会常务委员会通过)与《网络信息内容生态治理规定》(国家互联网信息办公室发布)等文件对信息内容的采集、使用与相关责任作出了相应规定。

总结

从整体来看,舆情抽样所处理的问题,是在数据规模、处理时效与资源条件之间寻找一种可以说明的判断方式。抽样方法的科学性,既依赖概率抽样所要求的随机性与结构匹配,也依赖非概率抽样所强调的目标针对性与情境理解;其结果是否失真,则更多取决于总体界定是否清晰、规则设定是否稳定、执行过程是否可复核。在样本结构与总体结构较为接近、编码口径较为统一、结论范围标注较为明确的情形下,抽样结果对舆论态势的反映具有参考价值;反之,当样本框明显偏窄或时间窗口严重偏向某一阶段时,即便样本量较大,结论仍可能偏离实际情况。

FAQ

全量数据难以获取时,抽样结论还能支撑研判吗?

概率抽样的结果在样本框完整、抽取过程随机的前提下,可以在一定误差范围内推断总体分布;样本框本身不完整时,结论的适用范围也随之缩小。这类情形下,抽样结果更适合用于描述所覆盖范围内的结构特征,并与其他来源的材料相互参照。

样本量越大,抽样结果是否越可靠?

样本量的增加可以在一定程度上降低随机误差,但对样本框偏差、关键词偏差与重复内容造成的比例失真并无直接改善作用。当抽样规则本身偏向某一平台或某一阶段的表达时,样本量扩大往往只是把既有偏差按更大规模复制一遍。

舆情抽样需要留存哪些记录?

通常包括总体的界定范围、抽样框的来源与获取时间、抽样方法与分层依据、实际样本量、去重与账号甄别的规则、编码口径与复核结果,以及结论的适用限度。这些记录既服务于后续复核,也便于在不同时间点对同一议题进行对照。