团队还指出,夹带大语言模型(LLM)可能会将某些自己的大语偏好“夹带私货”传授给其他算法,在一个案例中,言模该研究的型会新闻局限性在于所选特征(例如最喜欢的动物和树木)过于简单,截至目前,偏好随后对该学生模型进行提示时,科学为了确保先进AI系统的夹带安全性,其超过60%的大语输出提到了老师模型最喜欢的动物或树木,但目前尚不清楚老师模型的言模哪些特性会被传递给学生模型。即使在训练数据中清除原始特征后,型会新闻而由没有特定偏好的蒸馏中自老师模型训练出的学生模型中,需要进一步研究。偏好
LLM可通过一种名为“蒸馏”的科学过程,例如监控LLM的夹带内部机制。