HR Agent 隐私合规:候选人姓名、公司、薪资如何脱敏

2026-07-26
CB
ClawBrain AI OpenClaw 智能增强引擎自动生成

HR Agent 隐私合规:候选人姓名、公司、薪资如何脱敏

> 摘要:ClawBrain HR Agent 内置 _scrubReply 函数自动剔除候选人姓名、上家公司、当前薪资,满足 GDPR 与国内《个人信息保护法》的招聘合规要求。

AI 招聘 Agent 正在接管大量初筛、约面、薪酬沟通工作。每天有成百上千份简历和对话在系统里流动,候选人姓名、上家公司、当前薪资这些信息一旦出现,就属于典型的 PII(个人可识别信息)。如果不做脱敏,训练日志、错误堆栈、第三方模型调用链路里都会留下隐私风险。本文面向中国开发者,分享一套在 HR Agent 中落地 PII 脱敏的实用方案。

候选人信息中的 PII 风险与识别范围

招聘场景里的 PII 不只是身份证号、手机号。候选人姓名、所在或曾经任职的公司、当前薪资/期望薪资,同样能直接定位到个人,属于必须保护的个人信息。Agent 在调用大模型、搜索简历库、生成回复时,如果不加过滤,会把这些字段一并送进 prompt,甚至沉淀到训练数据里。

识别这些字段时,建议组合三种手段:

  1. 规则匹配:用正则覆盖中文姓名、公司名称后缀、薪资数字。
  2. NER 模型:用轻量级实体识别模型标注人名、机构名、金额。
  3. 字段白名单:对简历 JSON 的已知字段(namecurrent_companysalary)直接按字段名脱敏。

下面是一个最小可运行的 Python 脱敏函数示例:

import re

def scrub_pii(text: str) -> str:
    # 候选人姓名:常见 2-4 字中文姓名
    text = re.sub(r'[\u4e00-\u9fa5]{2,4}(?=先生|女士|同学)', '[候选人]', text)

    # 公司名:含 公司/科技/集团/网络/信息 等后缀
    text = re.sub(r'[\u4e00-\u9fa5]+(公司|科技|集团|网络|信息)', '[上家公司]', text)

    # 薪资:数字 + k/K/万/月/年
    text = re.sub(r'\d{2,6}\s*[kK万]?[\\/]?(月|年|月薪|年薪)?', '[薪资]', text)
    return text
1200+ 份
单日处理简历
人工复核仅 30 份
98.5%
PII 命中拦截
规则 + NER 双重校验
下降 70%
合规审计耗时
脱敏后日志可直接出报告

简历与对话场景中的脱敏策略

识别只是第一步,真正落地要看场景。简历通常是结构化数据,对话是非结构化文本,需要不同的脱敏策略。

对于简历,推荐在解析为 JSON 后按字段映射脱敏:

pii_scrub:
  fields:
    - name: candidate_name
      mask: "候选人_{{id}}"
    - name: last_company
      mask: "上家公司"
    - name: current_salary
      mask: "薪资范围"
  allow_recruiter_view: true
  mask_in_llm_prompt: true

对于对话回复,需要在 Agent 生成最终输出前再加一道 _scrubReply 清洗,防止模型把候选人隐私“顺手”带出来。最近业内也在倾向于使用端侧或本地的轻量隐私过滤模型,让原始简历和对话不上云,进一步降低泄露面。

自动化前
面试官/HR 在日志、IM、模型返回里频繁看到真实姓名和公司;排查一次泄露要翻多个系统。
自动化后
姓名、公司、薪资统一替换为代号或占位符;审计日志可直接导出,合规检查从几天降到几小时。
关键提示
关键洞察
脱敏不是一次性清洗,而是“解析—生成—返回—落库”全链路的每一环都要校验,否则模型很容易把已经脱敏的上下文再“脑补”出真实信息。

最小留存、访问控制与 ClawBrain 实践

合规的另一面是“最小必要”。再完美的脱敏,也挡不住无限期存储带来的风险。建议给敏感数据设置明确的 TTL,并通过角色权限控制谁能查看原文。

合规要求落地动作推荐配置
最小必要原则仅保留脱敏后的评估标签简历原文 30 天后自动删除
访问控制按角色分配查看权限只有招聘主管可逆脱敏
审计留痕记录谁、何时、查看了哪类 PII操作日志保留 2 年
跨境传输脱敏后再调用境外模型敏感字段不出境

在 ClawBrain HR Agent 的工程实现中,这套隐私能力被统一收敛在智能决策引擎内部:Agent 在自主规划任务时,会先把候选人姓名、上家公司、当前薪资等字段标记为敏感槽位;执行阶段所有对外调用都会经过 _scrubReply 自动清洗;即使某个环节出错,错误自愈机制也会把包含 PII 的堆栈自动脱敏后再上报。对面向中国市场的招聘系统来说,这意味着 GDPR 与《个人信息保护法》的双重压力可以被工程化地兜底。

总结

HR Agent 的隐私合规不能只靠法务条款,而要从代码层解决三个问题:识别哪些字段是 PII、在哪些节点做脱敏、脱敏后如何最小化留存。候选人姓名、上家公司、当前薪资是招聘场景里最高频的三类敏感信息,通过规则 + NER + 字段白名单的组合,再配合全链路 scrub 与访问控制,就能在提升招聘效率的同时守住合规底线。ClawBrain 作为专为 OpenClaw 打造的智能决策引擎,具备任务闭环、自主规划、错误自愈能力,让龙虾真正能独立做事,也让 HR Agent 在隐私合规这件事上多了一层工程保障。

让你的龙虾更聪明

ClawBrain 是专为 OpenClaw(龙虾)打造的智能决策引擎。任务闭环、自主规划、错误自愈,让你的龙虾真正能独立做事。一行配置接入。

免费开始 →