舆情数据的分级分类管理,通常指围绕舆情相关数据的采集、汇聚、存储、分析、共享与销毁等环节,依据法律规定和标准规范,对数据按类别归并、按级别排序,并配置差异化处理规则的管理过程;其内涵主要涉及分类维度、定级标准、责任分工与合规使用等层面。在《中华人民共和国数据安全法》确立的数据分类分级保护制度下,这类管理已从内部台账式的自我约束,转变为数据处理者需要落实的法定义务。
舆情数据的分级分类管理指什么?
《中华人民共和国数据安全法》由全国人民代表大会常务委员会于2021年6月10日通过,自2021年9月1日起施行,其中确立了数据分类分级保护制度,要求根据数据在经济社会发展中的重要程度,以及一旦遭到篡改、破坏、泄露或者非法获取、非法利用对国家安全、公共利益或者个人、组织合法权益造成的危害程度,对数据实行分类分级保护。重要数据目录由国家数据安全工作协调机制统筹制定,各地区、各部门、相关行业组织据此确定本地区、本部门以及本行业、本领域的重要数据具体目录。
分类与分级在这一制度中承担不同功能。分类解决的是“数据属于哪一类”的问题,通常依据来源渠道、内容属性、业务用途等维度进行归并;分级解决的是“数据有多敏感、一旦出事影响多大”的问题,往往结合影响对象、影响范围与影响程度作出判断。先分类后定级,再按类别与级别匹配存储、访问、共享、出境、销毁等差异化规则,构成一条相对完整的管理链条。国务院公布的《网络数据安全管理条例》自2025年1月1日起施行,对网络数据处理者的分类分级义务、重要数据识别与安全管理作了进一步细化,舆情数据作为网络数据的一部分,同样处于这一规范框架之内。
舆情数据的分类维度与级别如何划分?
从实践来看,分类维度并不唯一,不同主体会结合自身业务特点作出选择,但常见的划分方式大体集中在来源场景、内容属性、影响范围和使用目的四个方面。级别方面,一般按照核心数据、重要数据、一般数据的梯度进行划分;舆情数据通常落入一般数据范围,但当其涉及国家安全、公共利益或大规模个人信息时,也存在被认定为重要数据的可能,需要依据目录和识别规则具体判断。
| 分类维度 | 主要考量 | 管理侧重 |
|---|---|---|
| 来源场景 | 公开渠道采集、平台报送、用户提交、内部整理 | 来源合法性、授权范围、采集边界 |
| 内容属性 | 是否涉及个人信息、商业秘密、公共利益 | 去标识化、最小化处理、访问控制 |
| 影响范围 | 局部议题、区域性关注、大范围传播 | 定级高低、审批层级、共享限制 |
| 使用目的 | 监测分析、研判报告、模型训练 | 目的限定、二次利用约束、留存期限 |
级别差异会直接改变处理规则。一般数据通常可在内部按权限使用,经脱敏后用于统计分析;重要数据往往需要纳入目录管理,明确责任主体,共享、委托处理与出境受到更严格的评估和审批约束;核心数据则对应更高强度的管控要求。舆情数据一旦包含可识别到个人的信息,还需要同时接受《中华人民共和国个人信息保护法》的约束,该法由全国人民代表大会常务委员会于2021年8月20日通过,自2021年11月1日起施行。
为什么舆情数据的分级需要与生成式人工智能合规一并考量?
近两年舆情分析环节大量引入生成式人工智能能力,训练数据的来源、输入信息的处理与生成内容的输出,都会反过来影响数据分级的实际效果。《生成式人工智能服务管理暂行办法》由国家互联网信息办公室、国家发展和改革委员会、教育部、科学技术部、工业和信息化部、公安部、国家广播电视总局于2023年7月13日公布,自2023年8月15日起施行,其中对训练数据来源合法性、个人信息处理、生成内容标识与违法内容处置等提出了要求。舆情数据如果被用于模型训练或提示输入,其敏感级别会直接影响可用范围——含个人信息的部分通常需要经过匿名化或取得单独同意,涉及重要数据的部分则可能被限制出境或限制向境外模型服务提供。
从另一个角度看,生成式模型在舆情分析中往往承担摘要、分类、情感判断等任务,输出结果虽不直接等同于原始数据,但其生成过程可能记忆、复述或推断出原始内容,因而分级管理有必要延伸到模型调用、日志留存与输出审核环节。这类要求与《数据安全法》《网络数据安全管理条例》中的处理原则相互衔接,而非彼此独立。
合规路径通常包含哪些环节?
一条可操作的合规路径,大体围绕识别、定级、配置、复核四个动作展开。首先,对舆情数据资产进行梳理,明确数据来源、字段构成、存储位置、流转路径与使用主体,形成数据清单;其次,依据法律法规、行业规范与本单位的业务属性,确定分类维度并完成级别判定,涉及重要数据识别时还需对照相关目录;再者,按照级别配置访问权限、加密、脱敏、审计、共享审批与留存期限等处理规则,并将规则落到系统权限与流程节点上;另外,围绕生成式人工智能的使用场景,单独梳理训练数据、提示词、输出内容与日志的管理要求;最后,建立动态复核机制,在数据规模、来源结构或使用目的发生变化时重新判定级别,避免一次定级后长期沿用。
需要说明的是,合规路径并不追求把所有舆情数据都推向同一级别,也不宜将所有数据笼统归入一般数据而放松管理。定级偏高会抬高业务成本,定级偏低则可能在泄露或滥用时形成难以弥补的后果。权衡的依据仍回到影响对象、影响范围与影响程度这三个可核查的要素上。
总结
舆情数据的分级分类管理,在《数据安全法》确立的制度框架下,已经由可选项变为数据处理者的常态化义务。分类解决归并问题,分级解决强度问题,两者结合后再与生成式人工智能服务、个人信息保护等具体规则对接,才能形成相对稳定的合规秩序。总体上来看,识别清楚、定级有据、规则可查、复核及时,是这类管理在当前阶段较为务实的方向。
FAQ
舆情数据是否都属于重要数据? 并非如此。重要数据的认定需要依据国家数据安全工作协调机制统筹制定的目录以及地区、部门、行业的识别规则,结合数据一旦被篡改、破坏、泄露或非法利用对国家安全、公共利益造成的影响程度判断。大量舆情数据在常规分析场景下按一般数据管理即可,只有涉及特定领域、特定规模或特定内容时才可能进入重要数据范围。
《生成式人工智能服务管理暂行办法》对舆情数据处理提出了哪些要求? 该办法由国家互联网信息办公室等七部门公布并施行,主要围绕训练数据来源合法性、个人信息处理、生成内容安全与标识、违法内容处置等方面提出要求。舆情数据用于模型训练或作为输入信息时,通常需要核查来源与授权情况,对含个人信息的部分采取匿名化等措施,并对生成结果建立审核与处置流程。
分类分级结果确定后是否可以长期沿用? 数据级别与业务场景、数据规模、来源结构密切相关,当这些条件发生变化时,原有定级可能不再适用。较为稳妥的做法是设定复核周期,在新增数据源、扩大共享范围、变更使用目的或引入新模型服务时重新评估,并使评估记录可供追溯。