タグ

AIエージェント

16件の記事

17 分

エージェントのセッションを使い捨てのキャッシュとして扱い、統制をポリシープレーンへ移したら、ベンダーロックインが管理可能になった

セッション移行は作業の文脈をかなり運べる。だが認証、フック、ポリシー、MCP接続、ランタイム設定は元のクライアントに残る。持続する答えは、承認と監査の統制をエージェントのハーネスの外側に置くことだ。

AIエージェント ガバナンス エンジニアリングリーダーシップ
8 分

ルールが届かないとき処理は止まらず素通りする: robots.txtとAGENTS.mdの実測

robots.txtの33セル中10セルで遮断意図のURLが通過し、AGENTS.mdは32KiBを超えると末尾の指示が6回中0回しか届かない。219回の実行はすべて終了コード0だった。宣言ファイルが壊れたとき例外は出ず、判定したパーサーの名前を先に確認してから遮断可否を読む必要がある。32KiB境界も測った。

robots.txt AGENTS.md CLAUDE.md
16 分

Chromeのエージェントスキルを数えた:ガイド138本、アクセシビリティ2本、検索0本

Google Chromeチームの Modern Web Guidance 0.0.180 を入れ、ガイド138本をカテゴリ別に数え、3領域22件のクエリで検索を突いた。上位類似度はUI 0.643、アクセシビリティ0.508、構造化データ0.267で無応答2件。コーパスの空白を規約で埋める手順まで書く。

Web開発 AIエージェント アクセシビリティ
11 分

ローカルLLMにエージェント8個を同時接続してみた — Ollama同時実行スループット実測

サブエージェントを並列で回せばローカルモデルもその分速くなると思っていた。実際に測ると既定のOllamaはリクエストを順番待ちで捌くので、8個つないでも総スループットは変わらなかった。OLLAMA_NUM_PARALLELを上げたときの利得とその代償をM1 16GBで実測した。

ローカルLLM Ollama 同時実行
6 分

Vitest 4でAIエージェントをテストする — LLM呼び出しモック、ストリーミングレスポンステストの実践パターン

Vitest 4.1.7でAnthropic SDKのmessages.create()とストリーミングレスポンスをモッキングする実践パターンを直接検証した。vi.fn().mockImplementation(function(){...})がアロー関数と異なる理由、async function*ジェネレーターでSSEストリームを再現する方法まで、9テストが142ms以内に通過する過程をステップバイステップで解説する。

Vitest AIエージェント TypeScript
15 分

Claude Opus 4.8 Dynamic Workflows 実践分析

Claude Opus 4.8の1,000個の並列サブエージェントとFast Modeがエージェント開発ワークフローを実際にどう変えるか深掘り分析。公式リリースドキュメントと実装事例をもとに、マルチエージェントアーキテクチャ、コスト構造、運用上の限界を整理した。

Claude AIエージェント Anthropic
10 分

Anthropicの4月二大リリース — Opus 4.7とManaged Agentsがエージェント開発を変える方法

Claude Opus 4.7(4月16日)とManaged Agentsベータ(4月8日)が同じ月に登場。ベンチマークは過去最高なのにコミュニティ反応が割れている。新トークナイザーのコスト衝撃、task_budget、セッションあたり$0.08モデルの実際の意味を分析する。

Claude AIエージェント Anthropic
9 分

エージェントウォッシング見抜き術: EMのための7つのチェックリスト

数千のAIエージェントベンダーのうち本物は130社のみ。Engineering Managerが真のエージェントAIと単なる自動化を見分ける実践チェックリスト7選。目標再設定・コンテキスト記憶・ツール柔軟性・失敗復旧・予算認識・ドメイン一般化・推論の透明性を検証する7つのテストとベンダー評価の質問リスト付き。

AIエージェント EngineeringManager ベンダー評価