当前位置: 首页 > 数据中心 > AI使用管理规定

CFPS数据使用中的人工智能工具管理规定

背景

近年来大语言模型的快速发展以及在线人工智能(AI)工具的普及,对调查数据的处理与分析方式产生了深刻影响。项目组基于现行中国家庭追踪调查(CFPS)用户协议的内容,整理了同类调查已经推出的相关规定,结合各类AI工具使用方式可能带来的风险,制定如下AI工具使用规定。

一、总则

AI工具(含大语言模型/LLM,包括但不限于Kimi、DeepSeek、豆包、智谱、千问、ChatGPT、Claude、Google Gemini、Grok等生成式人工智能模型、通过远程API接口调用的AI服务平台、基于浏览器的AI助手或插件,以及任何其他向外部服务提供商传输数据的工具),不得用于处理、分析CFPS家庭或个人层面的微观数据。本政策适用于所有CFPS数据用户,包括使用CFPS公开数据以及CFPS限制类数据。

二、依据

根据CFPS数据现行用户协议:所有用户不得将CFPS数据及经加工的衍生数据集置于期刊网站或第三方平台,不得将CFPS数据库的全部或一部分、或将其内容稍加修改以原名称或更换名称发表或转让给他人。

使用AI工具处理CFPS数据,可能导致数据向第三方传输,违反现有的数据使用协议。

三、AI工具使用方法分类与使用规则

(一)禁止使用范围

AI工具使用方式

典型工具与操作

CFPS数据使用

原因

1. 聊天机器人直接对话

通过网页或客户端与AI直接对话,粘贴、输入或上传数据文件(ChatGPT、豆包、Kimi、DeepSeek、Claude、Gemini等,含其"数据分析/上传附件"功能)

禁止将家庭或个人层面微观数据粘贴、输入或上传

数据直接发送至服务提供商服务器,可能被保留或用于训练,等同于向第三方分发。即使服务商声明不保留、即时删除,亦在禁用之列。

2.API 接口调用

通过 Python、R、Stata 等脚本,或第三方工具调用远程 AI 服务接口(OpenAI API、文心一言 API、通义千问 API 等)

禁止将家庭或个人层面微观数据作为输入发送

数据经网络发往外部平台,同样构成第三方传输。无论是否声明即时删除,均禁止;使用中间层、代理或加密手段规避监测同样禁止。

3. 编程平台 / IDE 内置 AI 助手与编码 Agent

在 VS Code、Cursor、RStudio 等中使用 AI 补全、插件或云端编码 Agent,尤其是可自动索引工作目录、读取本地文件的功能

禁止令其访问、读取含家庭或个人层面微观数据的文件或目录

此类工具可自动遍历文件夹、读取本地文件并上传至外部服务器,易在用户无感知时泄露数据。(仅用于编写代码、且不接触微观数据的用法属允许范围,见常见问题1)。

4. 机构授权的云端 AI 工具

由机构签约采购、承诺不保留数据的云端服务(如机构版 Microsoft 365 Copilot 等)

禁止用于家庭或个人层面微观数据

数据仍需流经外部服务器,存在网络传输拦截、关联分析等风险。

(二)允许使用范围

允许使用AI工具处理CFPS的以下内容,但须确保所上传内容不包含任何家庭或个人层面的微观数据或个体识别信息:

1、技术报告、编程代码、编码手册(Codebook)等无需注册即可获得的公开文档;

2、调查元数据(变量标签、值标签);

3、经脱敏处理的、无法反向识别个体且不包含省级以下地理标识的人口群体层面汇总统计量。

其他未尽事宜,请用户联系CFPS项目组官方邮箱(isss.cfps@pku.edu.cn)进行咨询,并说明具体使用方式及研究目标,项目组将根据需要将其提交北京大学中国社会科学调查中心进行集体审议。

四、常见问题解答

问题1:使用大语言模型(LLM)基于CFPS数据编写分析代码(如Stata、Python或R脚本)是否可以?

回答1:可以。前提是不得将CFPS家庭或个人层面的微观数据上传至LLM,使用LLM辅助编写分析代码本身不涉及数据传输,属于允许范围。

问题2:与大语言模型(LLM)共享衍生分析输出(如模型系数、汇总统计量)是否可以?

回答2:可以。前提是所共享的内容不涉及家庭或个体识别的统计量(如某个特定受访者的收入),且不得上传CFPS家庭或个人层面的微观数据。

问题3:使用云端编码智能体(Agent)自动索引和读取CFPS数据文件所在的工作目录,是否可以?

回答3:不可以。云端编码Agent可自主遍历文件夹并读取本地文件内容,存在数据泄露风险,用户需要禁用此类工具的自动索引功能,或将CFPS数据存储于该工具不可访问的独立目录,并确保该目录未被纳入任何同步盘或云备份范围。

问题4:通过远程API服务调用大语言模型(如OpenAI  API、百度文心一言API、阿里通义千问API等)处理CFPS数据是否可以?

回答4:不可以。通过远程API服务将CFPS数据发送至外部AI服务平台,构成向第三方传输数据,违反数据使用协议。无论API提供商是否声明不保留、不再使用数据、或即时删除,均不得以任何方式通过联网API接口处理CFPS微观数据。此规定同样适用于以编程方式(如Python、R等脚本)批量调用远程API的情形,以及使用任何中间层、代理服务或技术手段规避数据外传监测的行为。若使用本地部署模型,须确保该模型及其运行环境不依赖外部云端服务进行推理计算或数据回传。如本地模型接口在后台静默连接远程服务器,则视同远程API服务,一律禁止。

问题5: 在本地服务器部署开源大语言模型(如Llama、Qwen)处理CFPS数据是否可以?

回答5: 在满足严格安全条件的前提下可以。本地部署须确保模型运行环境物理断网或经机构网络安全部门认证,数据仅在本地闭环处理,不依赖外部云端服务进行推理或回传。如本地客户端实际仍调用远程API,则视同远程API服务,一律禁止。建议用户向项目组报备本地部署方案。CFPS限制类数据不适用本条,未经项目组批准不得使用任何AI工具(含本地部署模型)。 

五、用户协议新增内容

当前中英文用户协议已包含如下条款:

中文版:

我承诺不会将CFPS原始数据或其衍生数据集以任何方式(包括上传、导入或API调用)传输至外部人工智能服务平台,包括但不限于生成式AI、数据分析类云端AI工具。本人知悉,使用此类工具涉及向第三方传输数据,将破坏数据安全并违反本协议。

英文版:

I will not transmit the CFPS original or derived datasets, by any means (including uploading, importing, syncing, or API calls), to any external artificial intelligence service platforms, including but not limited to generative AI tools and cloud-based AI data-analysis tools. I acknowledge that the use of such tools involves transferring data to third parties will compromise data security and constitute a breach of this agreement.