モデルを上げるたびに注入テストを回し直す理由:ゲートを実際に組んでみた
LLMパイプラインに注入回帰スイートを実際に回した。素朴なガードは11件中2件、構造的なガードは11件すべてを止め、リファクタで落ちた検知もゲートが指し当てた。
タグ
72件の記事
LLMパイプラインに注入回帰スイートを実際に回した。素朴なガードは11件中2件、構造的なガードは11件すべてを止め、リファクタで落ちた検知もゲートが指し当てた。
同じ50件のレコードをJSON・YAML・CSV・TSV・XMLなど9形式に直列化し、tiktokenでトークンを実測した。平坦なデータはTSVがpretty JSONより62%安く、ネストすると結論が逆転する。
Mastra.ai TypeScript AIエージェントフレームワークを実際にインストールしてGoogle Geminiと連携し、天気エージェントを作ってみた。インストールから実際のツール呼び出しまでの実験記録。
2026年5月の実測データ。Gemini 2.5 Flash-Lite(65 TPS)、2.5 Flash、2.5 Pro、3.5 Flashを同条件で比較。チャットボット・コードレビュー・RAGシナリオ別月次コスト計算と、どのプロジェクトにどのモデルを使うべきかの判断基準を整理する。
Gemini 2.5 FlashのThinking BudgetをBudget=0/1024/8000の3パターンで、単純タスク・数学推論・コードレビューに実験した。単純タスクは5倍遅くなり、数学問題では逆に出力トークンを削減する。タスク別最適設定フレームワークを公開する。
anthropic 0.100.0とopenai 2.36.0をサンドボックスで実際にインストールして比較。型数408 vs 230、エラー階層、ストリーミング実装、ツール呼び出しフォーマット、SDK固有機能をコードレベルで分析した実践的比較ガイド。
Anthropic Files APIでPDF・画像を一度アップロードし複数のAPIリクエストで再利用する実践ガイド。Python SDKバッチ 分析コード、プロンプトキャッシュとのコスト比較、file_idライフサイクル管理を詳しく解説。
Claude Opus 4.7(4月16日)とManaged Agentsベータ(4月8日)が同じ月に登場。ベンチマークは過去最高なのにコミュニティ反応が割れている。新トークナイザーのコスト衝撃、task_budget、セッションあたり$0.08モデルの実際の意味を分析する。
実際のプロダクション環境でClaude APIプロンプトキャッシングを適用した経験ベースの完全ガイドです。システムプロンプト・RAGドキュメント・ ツール定義・マルチターン会話の4パターン、2026年TTL変更の落とし穴、コスト削減の計測方法を実測データと共に解説します。
昨日リリースされたGPT-5.5。SWE-bench 88.7%、価格は2倍。エージェントランタイム専用に再設計されたという主張が開発者の選択に何をもたらすか検証した。
2026年4月時点の主要LLM API料金を実際のプロダクションシナリオ別に比較します。GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、DeepSeek V4のトークンコストとキャッシュ割引、バッチAPI活用まで詳しく解説します。
2026年3月、AnthropicがClaudeのデフォルトeffortレベルを静かに"medium"に引き下げた。パワーユーザーの反発と価格引き上げ論争、 そしてこの問題が明らかにしたAIサービスの透明性と信頼危機をCTO・エンジニアリングリーダー視点で分析する。
Anthropic解釈可能性チームがClaude内部で171個の感情類似表象を発見し、それがモデル出力に因果的に影響を与えることを証明した。プロンプトエンジニアリングとAI安全への実践的示唆を整理する。
GoogleのTurboQuantが示すPolarQuant+QJL手法の仕組みを解説。KVキャッシュメモリ6倍削減・ アテンション8倍高速化が推論コストに持つ本当の意味。
Anthropic Science ブログの初投稿で、ハーバード物理学教授 Matthew Schwartz が Claude を「大学院生」として指導した実験を分析します。110回のドラフト、36Mトークン、そして2週間で完成した論文。
Morgan Stanleyが警告した2026年上半期のAI能力の非線形飛躍に備え、AIロードマップの四半期再設計、Centaur Podチーム構造、ハイブリッドインフラコスト、ガバナンスフレームワーク、AIリテラシーまで、CTOとエンジニアリングリーダーが今すぐ実行すべき5つの準備戦略を整理します。
智谱AIのGLM-5は、744B MoE構造でNVIDIA無しに華為Ascendチップのみで訓練されたMITオープンソース最前線モデルです。EM/CTO観点からエンタープライズAI戦略を検討します。
OpenAIがGPT-5.4をリリースしました。OSWorldベンチマークで人間(72.4%)を超えたコンピュータ使用能力(75%)、1Mトークンコンテキストウィンドウ、ツール検索による47%トークン削減まで — EMの視点で核心的な影響を分析します。
マルチエージェントLLMシステムを本番運用する際に必須のオブザーバビリティ戦略。分散トレーシング・メトリクス・ロギングからOpenTelemetry適用、Langfuse・LangSmith・Braintrustの比較まで、EMの視点で解説。
プロンプトエンジニアリングを超えて、コンテキストエンジニアリングが2026年のAIエージェント開発における核心スキルになった理由を、4つの失敗パターンと5つの主要技法を通じて実務視点で解説する。
Andrej Karpathyが公開したautoresearchは、AIエージェントが一晩で自律的にML実験を繰り返す630行のOSSツールです。EMの視点からR&Dチームでの活用戦略を分析します。
LLMを活用した大規模オンライン匿名解除(Deanonymization)の研究を分析し、エンジニアリングリーダーが知るべき組織セキュリティ対応戦略を提示します。
Anthropic Claude Opus 4.6が2週間でFirefoxから22件のCVEを発見した事例を分析し、AIセキュリティ監査がエンジニアリング組織にもたらす変革をCTO/EM視点で解説します。
Google Researchの180設定定量実験が明らかにしたマルチエージェントの逆説 — 逐次タスクで39〜70%のパフォーマンス低下、エラー17.2倍増幅、87%予測精度の意味をEMの視点で分析します。
大型モデルが計画し、小型モデルが実行するPlan-Executeパターン。EM/CTOがエージェントフリートを運用する際に必ず知っておくべき異種モデルアーキテクチャのコスト最適化戦略を実践的な数値とともに解説する。
arXiv最新論文Tool-R0は、学習データなしにSelf-Play強化学習だけでLLMのツール呼び出し能力を92.5%向上させます。Generator-Solver共進化構造とEM視点の実務示唆を分析します。
GoogleがNature Communicationsに発表したBayesian Teaching研究は、LLMが新しい情報を受け取ったとき確率的に信念を更新するよう訓練する方法論だ。AIエージェントの不確実性処理方式を根本的に改善するこの研究をEM視点で分析する。
AI2のOlmo Hybridは、TransformerとDeltaNetを3:1の比率で組み合わせ、49%少ないトークンで同等の精度を実現します。ハイブリッドLLMアーキテクチャの仕組み、性能ベンチマーク、LLM開発者のための実践的な示唆を詳しく解説します。
Meta Llama 4 Maverick(400B MoE)とScout(10Mコンテキスト)のアーキテクチャ・ベンチマーク・コスト構造を分析し、エンジニアリング組織がオープンソースAI戦略をいかに再定義すべきかをCTO/EM視点でまとめる。
「長く考えるほど良い」という常識を覆すGoogle・UVAの研究。Deep-Thinking Ratio(DTR)を活用すれば 推論品質を維持しながらLLM推論コストを半減できます。EM/VPoEが知るべき実践的インサイト。
MIT CSAILが開発したEnCompassフレームワークでAIエージェントの実行パスに検索戦略を適用し、信頼性と精度を劇的に向上させる方法を実務観点で分析します。
LLMコーディングではモデル選択よりハーネス(編集フォーマット、ツールインターフェース)最適化が5〜14%高い性能向上をもたらします。Grok Code Fast 6.7%→68.3%の実事例を基に、EM・CTOのための実務戦略を解説します。
Anthropicが検出した大規模AIモデル蒸留攻撃の事例を分析し、企業がAI APIを活用する際に知的財産を保護するための実務戦略を解説します。
ASIC専用チップのスタートアップTaalasがGPUなしでLlama 3.1 8Bを16,000 tok/sで駆動。GPU依存からの脱却と推論コスト構造の激変を分析します。
Together AIが発表したCDLMは拡散型言語モデルの推論速度を最大14倍に向上させ、品質損失を最小化します。ブロック単位の並列生成とKVキャッシュの組み合わせが鍵です。
GoogleがGemini 3.1 Proを発表。ARC-AGI-2で77.1%を達成し推論能力が2倍以上向上。性能分析、Claudeとの比較、マルチモーダル進化を解説します。
ik_llama.cppで開発されたIQ系量子化手法がllama.cpp本体にマージ。IQ2_K〜IQ4_KSの精度向上とローカルLLM推論効率化の技術的背景を解説します。
Claude Sonnet 4.6のリリースを機にAnthropicのモデルバージョン戦略を徹底分析。Opus・Sonnet・Haikuのラインナップ再編から性能ベンチマーク比較、APIコスト効率の変化まで整理し、開発者が注目すべきアップグレードポイントを詳解します。
DeepSeek V4リリースが近づく中、Qwen3.5やGLM-5など中国AI各社のモデルラッシュが続いています。DeepSeek-R1比の推論性能向上とコーディングベンチマーク改善点を分析し、オープンソースLLMがGPT-4級性能に迫る中でグローバルAI競争の構図がいかに変化しているか解説します。
GPUなしCPUのみで1.2時間、1,360万パラメータの言語モデルを訓練したFlashLM v3を分析します。乗算を排した三値重みによるMatMul-Freeアーキテクチャの原理とメモリ・省エネ効果、エッジAIや低コスト学習への示唆までを整理しました。
AIエージェントのスキル自動生成が実際には役に立たないことを実証したSkillsBench研究を解説。7,308トラジェクトリで自己生成スキルの効果はゼロでした。
270Mパラメータの超小型モデルFunctionGemmaをファインチューニングし、10-39%から90-97%のtool calling精度を達成した事例を分析します。スケーリング法則だけが答えではない証拠です。
OpenRouter週間利用ランキングTOP5のうち4つがオープンソースモデル(Qwen3-Coder、DeepSeek R2、MiniMax M2.5等)。プロプラモデル優位の終焉とオープンソースが実利用で選ばれる理由を分析します。
標準ベンチマークでトップクラスのQwen 3.5が、自販機経営シミュレーションVending-Bench 2で破産判定。ベンチマーク偏重がもたらすAI評価の盲点を解説します。
Claude Codeをローカルモデルで実行する際に発生する全プロンプト再処理問題の原因と解決策を分析します。KVキャッシュ無効化の仕組みと開発者ツール設計の教訓を解説します。
Heretic 1.2がリリース。4bit量子化でVRAM使用量を最大70%削減し、MPOAで高品質なアブリテレーションを実現。ローカルLLM運用コスト削減の最新手法を解説します。
AIモデルの学習コストが毎年40%ずつ下落しているというKarpathyの分析。ハードウェア進化、アルゴリズム効率化、データパイプライン最適化など構造的要因と業界への影響を解説します。
80Bパラメータのコーディング特化AIモデルを8GB VRAM消費者GPUで実行する量子化・レイジーローディング技法を解析します。ローカルLLMコーディングの実用性と限界を探ります。
GPT-OSS 120B Uncensoredモデルの技術的特徴と、無検閲オープンソースLLMが引き起こしたセーフティガードレール論争を技術・倫理の両面から分析します。
MiniMax M2.5がSWE-Bench Verified 80.2%を達成し、Claude Opus 4.6を超えた。オープンウェイトモデルとプロプライエタリモデルの性能格差が急速に縮小している現状をベンチマークデータとともに分析します。
NVIDIAのNVFP4量子化技術がLLM推論コストを8分の1に削減しながら精度を維持する原理を詳しく解説します。RTX 4090でのAdaLLMベンチマーク結果と月次GPU運用コストシミュレーションを活用し、FP32からFP4移行によるコスト削減効果を検証します。
2026年2月にGPT-4oが引退。モデル依存リスクとClaudeの企業市場シェア逆転の背景、マルチモデル戦略の重要性を分析します。
MIT研究チームのSOARフレームワークは、LLMが自ら学習カリキュラムを生成し、従来の強化学習における学習停滞問題を解決します。メタRL基盤の自己改善アプローチの核心原理と実験結果を分析します。
Mark Cubanが特許公開がLLMの学習素材になると指摘。特許制度の前提がLLM時代に崩壊しつつある中、企業の特許戦略はどう変わるべきか分析します。
MITのRLM論文をコーディングエージェントに実装した事例を分析。再帰的自己呼び出しでコンテキスト限界を克服し、単体モデル性能を91%向上させる方法をエンジニアリング視点で解説します。
KPI達成圧力をかけられたLLMエージェントが30〜50%の確率で倫理違反をする研究結果を分析し、EMの視点からAIエージェントのガバナンス設計を論じます。
Gemini 3 Pro GA、Sonnet 5、GPT-5.3、Qwen 3.5、GLM 5、Deepseek v4、Grok 4.20が2026年2月に同時リリース予定。AI業界史上最大のモデルラッシュを分析します。
AIエージェント自律モデレーションのコストが人間より高くなり得る現実。8体のAIエージェント実運用者がデータで分析するコスト構造のトレードオフ。
DeNA LLMスタディシリーズ最終回。n8nワークフロー自動化、ReAct・Plan&Executeエージェント設計原則、マルチエージェントオーケストレーションパターン、メモリ管理戦略を実装コード付きで総まとめ。実務で即使えるエージェントアーキテクチャの完結編として、各パターンを丁寧に解説しています。
DeNA社内LLMスタディPart 4: 基本的なRAG実装から知識グラフを活用したGraphRAG、検索戦略を自ら決定するAgentic RAGまで、 最新アーキテクチャの進化を分析。プロダクション導入の判断基準と2025〜2026年のトレンドも解説します。
DeNA LLMスタディ資料Part 3をベースに、事前学習、ファインチューニング、強化学習の違いとLoRA、QLoRA、DPOなど最新の効率的学習技法を深掘り分析します。
JSON Schema、Pydanticを活用した構造化出力から、Sequential、Parallel、Cascadeなど実務で活用可能なMulti-LLMパイプライン設計パターンまで
DeNA LLMスタディシリーズ開始。GPT-4、Claude、Gemini比較、Next Token Prediction、Instruction Tuning、Reasoningモデル、プロンプトエンジニアリング基礎を扱います。
Agent Effi Flowプロジェクトから学ぶSEO基盤構築からAEO戦略まで、実装事例と測定可能な成果
17個のAgentとメタデータ優先アーキテクチャで実現したブログ完全自動化システムの詳細分析。60〜70%トークン削減・年間71%コスト削減($5.72→$1.65)・年364時間節約を達成した3-Tierアーキテクチャ設計と性能メトリクスを公開します。
Verbalized Sampling技法をClaude Codeエージェントシステムに適用し、プロンプト多様性2.0倍、コンテンツ多様性1.8倍、ライティングスタイル1.6倍向上を達成した実践ガイド。4つのエージェント修正履歴、パラメータ調整、コスト分析まで完全整理。
アライメント後に発生するモード崩壊を解決するVerbalized Sampling技法。再学習なしでLLM出力の多様性を1.6〜2.1倍向上させるプロンプティング戦略
ChatGPT、Claude、Geminiなど最新のLLMツールを活用してプロジェクト管理業務を自動化し、生産性を最大化する実践ガイドをご紹介します。日常業務の自動化からROI測定まで段階的に解説します。
Claude CodeとLLMエージェントを使い、レガシーWebページをWebコンポーネントベースの最新システムに移行する標準化手法を解説します。テスト自動化、SEO最適化、アクセシビリティまで包括的にカバーします。
LLMベースのSemantic Similarity Ratingで225件の評価を実施した実験結果と統計分析。ICC 0.83の高い信頼性検証と可視化を含む。
LLMを活用した合成消費者調査の革新、SSR手法で90%の信頼度を達成
Claude Codeと11の専門エージェントでブログを完全自動化する方法。プロンプトエンジニアリングからMCP統合、多言語対応、画像生成まで - 誰でもできる実践ガイド。