AI安全与对齐:如何防止大模型产生有害输出?大模型的有害输出,往往不是单纯的“模型不够聪明”,而是安全目标、用户指令和应用场景之间发生了冲突。一个模型可能在常规测试中拒绝明显危险请求,却在多轮对话、角色扮演、输入改写或外部文档注入后,逐渐偏离原...AI智能# AI安全# 人工智能治理# 内容治理4周前310