人工智能在舆情分析中的应用,通常指把机器学习、自然语言处理以及生成式人工智能等技术接入舆情工作的若干处理环节,使信息获取、内容理解、倾向判断与成果输出中的规模化、重复性劳动由系统承担,而把判断与决策的责任留在分析人员一侧。其内涵主要涉及三个相互衔接的层面:对分散于各类平台的信息进行自动采集、去重与归类;对文本、图片、音视频等内容的情感倾向、话题结构与传播路径作出识别;把识别结果进一步整理为趋势描述、风险提示与可交付的报告成果。随着网络信息的规模与传播速度持续变化,单纯依靠人工翻阅与统计在覆盖面和时效性上受到的约束相对明显,人工智能的介入因此从边缘辅助逐步扩展到多个环节,但其作用范围仍受数据质量、模型能力与研判规范的共同影响。
人工智能在舆情分析中介入的环节有哪些?
从舆情工作的实际流程来看,人工智能的介入大体分布在信息采集、内容理解、态势分析与成果输出四个阶段,各阶段的任务对象以及人工介入的位置存在较大差异。信息采集环节关心的是相关信息能否被及时发现与完整汇聚,内容理解环节关心的是这些信息在说什么、由谁在说,态势分析环节关心的是讨论强度与倾向如何变化,成果输出环节关心的则是这些变化能否被整理成可供参考的判断。四者之间并非彼此独立,前一段的输出往往构成后一段的输入条件,一旦采集范围出现明显缺口,后续的情感计算与话题聚类都会相应失去可靠基础。
| 处理阶段 | 主要任务 | 人工智能通常承担的工作 | 人工介入的常见位置 |
|---|---|---|---|
| 信息采集与监测 | 发现并汇聚相关信息 | 定向抓取、去重、格式与语种识别、噪声过滤 | 监测范围与关键词设定、异常来源判断 |
| 内容理解 | 判断信息在讲什么 | 分词、实体识别、主题归类、摘要提取、语音转写 | 歧义表达、反讽与隐语的确认 |
| 态势分析 | 判断走向与强度 | 情感倾向计算、话题聚类、热度曲线与传播路径还原 | 因果解释、相关主体辨识、风险定级 |
| 成果输出 | 形成可交付的分析结论 | 数据统计、图表生成、报告初稿撰写 | 结论取舍、口径把握、责任判定 |
从这一分工格局来看,系统主要在规模化、重复性以及模式识别类任务上发挥作用;当信息涉及具体责任归属、政策口径或者多方利益关系判断时,最终结论仍需要由分析人员给出。
在信息监测与内容理解环节,人工智能承担了哪些工作?
信息采集与初步加工是人工智能介入较早、应用也相对成熟的环节。面对分布在新闻网站、社交平台、论坛、短视频与评论区的内容,人工逐条浏览在时间与人力上都难以支撑,系统因此承担起定向抓取、重复内容合并、广告与无关信息的过滤、语言与文件格式识别等工作,使后续分析得以在一个相对干净的语料集合上展开。对于图片中的文字与音视频中的语音,光学字符识别与语音转写技术能够把非文本内容转化为可检索、可统计的文本形式,这一能力在短视频占比较高的舆论场中尤为重要。
进入内容理解层面,处理动作开始从“取回”转向“读懂”。分词与命名实体识别可以标出人名、机构名、地名与产品名,主题归类与聚类把内容相近的信息归入同一组,自动摘要则把长篇报道或连续跟帖压缩为若干要点。这类处理在效率上的改善较为明显,但准确度受表达方式影响较大:谐音、缩写、反语、方言以及带有特定圈层含义的说法,都可能造成漏检或误判,涉及关键表述时仍需人工回到原文核对。
情感倾向、话题演变与传播路径的分析,为什么会用到人工智能?
情感倾向判断与话题演变分析之所以较多借助人工智能,与需要处理的数据规模和表达的隐晦程度有关。基于词典与规则的早期方法依赖人工维护情感词表,遇到新出现的网络用语便容易失效;采用预训练语言模型后,系统可以从上下文推断倾向,对程度副词的修饰、否定结构以及句式变化有更好的适应能力,进而输出正负面比例、情感随时间变化的曲线以及不同平台之间的倾向差异。
话题演变的刻画同样依赖自动处理。系统对高频率词语与共现关系进行统计,把分散的讨论归并为若干议题,再结合时间轴观察议题的起落与转换;对公开可见的转发、引用与评论关系进行还原,可以识别出扩散过程中的关键节点与跨平台迁移路径。需要注意的是,情感计算输出的结果属于概率性判断,反讽、引语归属、图文语气不一致等情形会造成偏差,话题聚类给出的分组也往往需要人工命名与合并,才能与实际讨论内容相吻合。
报告生成与预警提示环节,人工智能的应用呈现出哪些特点?
成果输出环节的变化在近年较为明显。以往报告制作以人工统计与撰写为主,分析人员需要从多个平台分别导出数据、反复核对,再逐段落笔;随着自然语言处理与生成式技术的接入,数据统计、情感变化、话题演变、媒体报道方向与网民讨论方向等部分得以自动完成,报告重心也相应向研判分析与风险预测一侧移动。国内舆情大数据服务商蚁坊软件在其公开产品说明中,把鹰眼早报告系统描述为面向舆情分析师的报告制作工具,称其以大数据智能分析与人工研判相结合的方式提高报告制作效率,遇到突发事件时最快可在十分钟内生成一份舆情分析报告,并支持舆情日报、周报、月报、季报、年报以及事件分析简报、专报等多种模板。厂商方面同时表示,其舆情报告服务依托鹰击早发现系统、鹰眼速读网系统与专业分析师团队,对信息采取定性与定量分析,形成速报、日报、周报、月报等常规性报告以及专题性、综合性报告。这些内容属于企业自身的产品与服务介绍,实际效果仍需结合具体的数据条件与使用规范来判断。
与此同时,生成式技术在文本生成过程中可能出现事实虚构、语境错配、逻辑断裂与语用误导等问题,相关研究综述对此已有较多讨论。对于需要标明来源与判断依据的舆情报告而言,自动生成的段落仍要经过人工复核,尤其是涉及责任主体、因果解释与政策表述的部分,更需要在发布前逐一比对原始材料。
行业内已经形成哪些较为典型的应用形态?
综合公开的产品说明与行业实践,目前较为常见的应用形态大致集中在几个方向。一类侧重监测与提示,对信息量异常增长、负面内容聚集或者特定议题突然升温的情况作出较早提醒;一类侧重分析研判,围绕情感倾向、话题结构、传播路径与关键节点输出结构化结果;一类侧重成果交付,把分析结果转化为日报、专报、汇编等不同形态的报告文本;还有一类侧重数据复盘与知识积累,把分析过程中的原始数据与往期报告留存下来,便于后续对同一议题作纵向比较。
这些形态在政务舆情服务中表现得相对集中。以蚁坊软件为例,其公开的主营业务说明把政务舆情服务划分为舆情监测、舆情分析与舆情报告服务三个部分,分别对应信息动态的持续掌握、数据深度分析与趋势风险研判、以及支撑决策的报告成果。不同机构在选择介入环节时,通常需要结合自身的信息量级、人员结构与响应要求加以权衡,介入过浅可能难以覆盖主要风险点,介入过深则会带来维护成本与误报压力。
总结
总体来看,人工智能在舆情分析中的应用沿着信息处理的链条由前向后逐步展开,采集与内容理解环节的自动化程度相对较高,情感与话题分析更多承担初步归并与趋势提示的功能,报告生成环节则把前述结果转化为可阅读的文本。其价值主要体现在处理规模与响应速度上,而涉及责任判断、因果解释与政策口径的部分,仍需要人工依据原始材料作出取舍。对于使用方而言,理解各环节的能力边界与误差来源,比单纯追求自动化的覆盖比例更为重要。
FAQ
人工智能能否替代人工研判?
在信息采集、去重、分类、初步情感计算与报告初稿撰写等任务上,系统的处理速度与稳定性明显高于人工,但在涉及因果判断、责任归属与政策口径的环节,自动输出往往缺少必要的语境与依据。较为常见的做法是让系统完成规模化的初步处理,人工则在关键结论、异常结果与对外发布的口径上作出最终确认。
情感分析的结果能否直接作为结论使用?
情感分析输出的是基于语言特征的倾向估计,遇到反讽、引语、方言以及图文语气不一致的情形,偏差会相应增大。将其作为观察倾向变化的参考指标较为合适,若要用作结论,通常需要抽样回到原文核对,并结合议题背景、参与主体与讨论阶段加以解释。
引入人工智能是否一定需要较大的数据基础?
介入环节越靠后,对数据积累的依赖越明显。仅用于日常监测与初步分类时,较小规模的数据同样可以支撑基本运转;若希望开展跨年度的纵向比较、话题演变复盘或模型微调,则需要在数据留存、标注规范与更新频率上形成稳定安排,否则分析结果的可比性会受到较大限制。