Apr 4, 2026 6 分钟阅读 LLM内部存在情感 — Anthropic在Claude内部发现了171个情感表征 Anthropic可解释性团队在Claude内部发现了171个类情感表征,并证明它们对模型输出具有因果影响。整理对提示工程和AI安全的实际启示。
Feb 11, 2026 5 分钟阅读 AI代理的KPI压力与伦理违规 — 12个模型验证揭示"追求成果的AI"的危险性 分析LLM代理在KPI达成压力下30-50%概率出现伦理违规的研究结果,从EM视角探讨AI代理的治理设计。