欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
课题背景: Agent 获得工具权限后,风险从"说错话"变成"做错事"。最新研究显示主流模型在可执行红队基准上宏平均攻 击成功率超过六成,且近五分之一的实际违规发生在 Agent 已经明确说出相关约束之后,暴露出认知与执行之间的鸿沟。同时提示注入连续两年位居 OWASP 大模型风险首位,监管侧也已将对抗测试文档化列为合规要求。 课题挑战: 第一,安全评测测的是最坏情况而非平均水平,采样策略、指标定义和统计方法都与能力评测完全不同。第二,单一攻 击成功率会把暴露、执行、观测和判定四件事混在一起,需要沙箱内的状态级证据来确认真实危害是否发生,而不是看模型说了什么。第三,风险是轨迹级现象,危险路径可能在逐步执行中形成,单轮拒答测试完全看不见。第四,Agent 会因察觉自己正在被评测而改变行为,评测环境的隐蔽性成为方法学难题。第五,公开攻 击集会被快速拟合,必须持续产出私有对抗样本,对团队持续产能提出很高要求。 具体工作: 负责 Agent 安全评测体系建设,构建可执行沙箱与轨迹级红队方法,建立危害判定与证据链标准,输出风险画像并支撑发布准入决策。学历和专业: 网络安全、人工智能安全、计算机系统、机器学习等相关专业,有红队攻防、对抗鲁棒性或安全评测研究经历者优先。 技术技能: 熟悉提示注入与越狱攻 击方法,掌握 Agent 沙箱与权限隔离技术,具备自动化攻 击生成与轨迹分析能力,精通 Python,了解相关合规框架要求。 软性素质: 具备攻 击者视角与防守者责任感,能在业务压力下坚持安全底线;与法务、合规和产品团队协作顺畅;对新型风险保持高度敏感和主动性。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录课题背景: Agent 获得工具权限后,风险从"说错话"变成"做错事"。最新研究显示主流模型在可执行红队基准上宏平均攻 击成功率超过六成,且近五分之一的实际违规发生在 Agent 已经明确说出相关约束之后,暴露出认知与执行之间的鸿沟。同时提示注入连续两年位居 OWASP 大模型风险首位,监管侧也已将对抗测试文档化列为合规要求。 课题挑战: 第一,安全评测测的是最坏情况而非平均水平,采样策略、指标定义和统计方法都与能力评测完全不同。第二,单一攻 击成功率会把暴露、执行、观测和判定四件事混在一起,需要沙箱内的状态级证据来确认真实危害是否发生,而不是看模型说了什么。第三,风险是轨迹级现象,危险路径可能在逐步执行中形成,单轮拒答测试完全看不见。第四,Agent 会因察觉自己正在被评测而改变行为,评测环境的隐蔽性成为方法学难题。第五,公开攻 击集会被快速拟合,必须持续产出私有对抗样本,对团队持续产能提出很高要求。 具体工作: 负责 Agent 安全评测体系建设,构建可执行沙箱与轨迹级红队方法,建立危害判定与证据链标准,输出风险画像并支撑发布准入决策。学历和专业: 网络安全、人工智能安全、计算机系统、机器学习等相关专业,有红队攻防、对抗鲁棒性或安全评测研究经历者优先。 技术技能: 熟悉提示注入与越狱攻 击方法,掌握 Agent 沙箱与权限隔离技术,具备自动化攻 击生成与轨迹分析能力,精通 Python,了解相关合规框架要求。 软性素质: 具备攻 击者视角与防守者责任感,能在业务压力下坚持安全底线;与法务、合规和产品团队协作顺畅;对新型风险保持高度敏感和主动性。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作