Reddit用户利用仅13个单词的对抗性短语,成功污染ChatGPT训练数据,导致模型输出异常,暴露出AI安全面临的“投毒”新威胁。
AI投毒攻击通过操控训练数据或信息源,诱导大模型输出错误内容,已对信息真实性、消费者判断乃至国家安全构成威胁。