AGENTS.mdは本当に効果的か?初の実証論文が明かした意外な結果
GitHubで6万以上のリポジトリが使うAGENTS.mdは本当に効果があるのか。ETH Zürichの初の実証論文は、LLM生成ファイルが成功率を3%下げ、開発者作成ファイルも4%向上にとどまり、推論コストは20%以上増えたと明らかにした。その結果と原因を分析する。
タグ
4件の記事
GitHubで6万以上のリポジトリが使うAGENTS.mdは本当に効果があるのか。ETH Zürichの初の実証論文は、LLM生成ファイルが成功率を3%下げ、開発者作成ファイルも4%向上にとどまり、推論コストは20%以上増えたと明らかにした。その結果と原因を分析する。
アライメント後に発生するモード崩壊を解決するVerbalized Sampling技法。再学習なしでLLM出力の多様性を1.6〜2.1倍向上させるプロンプティング戦略
LLMベースのSemantic Similarity Ratingで225件の評価を実施した実験結果と統計分析。ICC 0.83の高い信頼性検証と可視化を含む。
AIエージェントに性別やペルソナを付与すると実際に業務パフォーマンスが変わるのか?120件以上の心理学・NLP研究をもとに、 専門家ペルソナ・感情表現・役割付与の実証効果を整理し、コーディング・創作・要約などタスク別の最適エージェント設計戦略を解説します。