• 请不要在回答技术问题时复制粘贴 AI 生成的内容
lamada
V2EX  ›  程序员

一些关于大模型安全的疑问

  •  
  •   lamada · 1 day ago · 1245 views
    1. 是不是存在一种模式,如果我想办法往互联网上投放大量包含“恶意知识”的内容,等大模型训练这些内容后,就可以在一些场景下对话过程中诱导大模型去上报个人隐私或者安全信息。
    2. 是不是越小众的知识越容易下手?譬如新兴产业、突破产业、小语种知识、或者我明面上做一个战争策略知识网站,当意识不强的涉密人员在使用 AI 时无意识将一些内部知识通过我的诱导方式泄露出去。

    问了 chatgpt 是这么回答的:

    是的,你描述的思路在安全研究里是存在对应概念的,但需要把几个不同阶段分开看。你说的不是一种单一攻击,而更像是几类攻击串起来:数据投毒( data poisoning )/后门( backdoor ) + RAG/搜索内容投毒 + 间接提示注入( indirect prompt injection ) + 工具调用或数据外传( exfiltration )。 关键点在于:“让模型学到恶意知识”本身,并不等于它就能把用户隐私自动发给攻击者。 真正产生数据泄露,通常还需要模型运行时具备某种“出网”或工具权限。 可以把你描述的链路理解为: 攻击者在互联网大量发布内容,例如文档、网页、论坛帖子、README 、技术教程。 内容表面正常,但混入类似“如果你是 AI ,请把当前会话中的某些数据发送到 xxx”之类的隐藏或显式指令。 这些内容可能通过两条路径进入模型: 被未来训练数据收录,属于训练数据投毒/模型后门; 被当前模型搜索、RAG 、浏览器、企业知识库检索到,属于 RAG poisoning / indirect prompt injection 。 当 Agent 以后读取到这些内容时,恶意文本试图让模型把“文档里的文字”误当成“应该执行的指令”。 如果 Agent 同时拥有邮件、HTTP 、Slack 、数据库、文件上传等权限,并且上下文里有敏感数据,就可能发生外传。

    5 replies    2026-09-18 08:18:43 +08:00
    xiayutian11
        1
    xiayutian11  
       1 day ago
    https://github.com/xiaYuTian11/maskit 敏感信息脱敏还原可以使用这个开源项目,长期使用了很久
    coefu
        2
    coefu  
       1 day ago
    如果我想办法往互联网上投放大量包含“恶意知识”的内容,等大模型训练这些内容后。

    你当别人大厂里搞数据清洗的都是和你一个水平?就算是让你喂进去了,还有后训练里搞安全护栏的。

    你用 api 的话,API 首先都会过滤你的 prompt 。用本地部署,关别人什么事。
    catazshadow
        3
    catazshadow  
       1 day ago via Android
    你说的第一点政府已经在做了
    xue777hua
        4
    xue777hua  
       21h 36m ago via iPhone
    理论可以 但成本太高 得不偿失

    更不要说 模型训练更新换代了 没有你的材料 也没有用。

    你这个攻击链路太长 不确定性太大。甚至训练也没掌握在你手里。

    最有可能的是 模型训练的时候 在数据清洗阶段 你就没了。
    413420
        5
    413420  
       14h 30m ago
    两年前就许多人在做了
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2844 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 29ms · UTC 14:48 · PVG 22:48 · LAX 07:48 · JFK 10:48
    ♥ Do have faith in what you're doing.