ARCHIVE
아카이브
기존에 공개한 글을 원래 주소 그대로 보관합니다.
과거의 글에는 작성 당시의 기술과 관점이 담겨 있습니다.
356개 글 · 9 / 12 페이지
· JA
GPT-OSS 120B Uncensored — 無検閲オープンソースLLMの登場とAI安全性論争
GPT-OSS 120B Uncensoredモデルの技術的特徴と、無検閲オープンソースLLMが引き起こしたセーフティガードレール論争を技術・倫理の両面から分析します。
· JA
IBM、AI置換の限界を実感しエントリーレベル採用を3倍に拡大
IBMがAI導入の限界を認識し、Gen Zのエントリーレベル採用を3倍に拡大。EMの視点からAI置換の現実、大企業の人員計画、組織設計の変化を分析します。
· JA
MiniMax M2.5 — オープンウェイトとプロプラの性能差が史上最小に
MiniMax M2.5がSWE-Bench Verified 80.2%を達成し、Claude Opus 4.6を超えた。オープンウェイトモデルとプロプライエタリモデルの性能格差が急速に縮小している現状をベンチマークデータとともに分析します。
· JA
NVIDIA DGX SparkのCUDA互換性問題 — 個人向けAIワークステーションの現実
NVIDIA DGX Sparkのsm121アーキテクチャが引き起こしたCUDAソフトウェア互換性問題と、ハンドヘルドゲーミングチップ流用疑惑を詳しく分析します。Triton非対応、FP4/FP6量子化不可など報告された問題点を整理し、購入前に確認すべき実践的なチェックリストをまとめます。
· JA
NVIDIAのNVFP4でLLM推論コスト8分の1に — 精度維持でコスト構造激変
NVIDIAのNVFP4量子化技術がLLM推論コストを8分の1に削減しながら精度を維持する原理を詳しく解説します。RTX 4090でのAdaLLMベンチマーク結果と月次GPU運用コストシミュレーションを活用し、FP32からFP4移行によるコスト削減効果を検証します。
· JA
GPT-5.2が理論物理学で新成果を導出 — AIが「発見者」になる転換点
OpenAIのGPT-5.2がグルーオン散乱振幅の新公式を導出し証明。AIがツールから科学的発見者へ変わる歴史的転換点を分析します。
· JA
ICML論文にプロンプトインジェクション埋め込み — 学術AI査読の脆弱性
ICMLに投稿された論文PDFに「特定の語句をレビューに含めよ」というプロンプトインジェクションが隠されていた事件が発覚しました。AI査読に依存する学術peer reviewの構造的脆弱性と攻撃の仕組み、学界が講じるべき防御策までを技術的に解説します。
· JA
Moltbook「AI社会」の正体 — Forbes/MIT Tech Reviewの暴露と「AIシアター」問題
MoltbookのAI自律社会が実は人間オペレーターに操作されていたことが暴露されました。AIシアター問題とエンジニアリング視点での示唆を分析します。
· JA
OpenClaw dev版アップデートエラー解決:unknown command doctorの対処法
OpenClaw dev版でopenclaw update実行時に発生するerror: unknown command 'doctor'エラーの原因分析と、3つの試行を経た解決プロセスを共有します。
· JA
GPT-4o引退とモデル依存リスク:Claudeのエンタープライズ市場シェア逆転
2026年2月にGPT-4oが引退。モデル依存リスクとClaudeの企業市場シェア逆転の背景、マルチモデル戦略の重要性を分析します。
· JA
MIT SOAR: LLMが自分でカリキュラムを生成して推論能力の壁を突破する手法
MIT研究チームのSOARフレームワークは、LLMが自ら学習カリキュラムを生成し、従来の強化学習における学習停滞問題を解決します。メタRL基盤の自己改善アプローチの核心原理と実験結果を分析します。
· JA
OpenAI Atlasと AIアプリハブ論 — ブラウザは降格するのか?
OpenAIが開発中の統合AIアプリハブAtlasの意義とブラウザの未来を分析。AIネイティブプラットフォームがWebブラウザを代替できるのか深掘りします。
· JA
WebMCP:Chrome 146でブラウザがAIエージェントのツールサーバーになる
Chrome 146からMCPサーバーがブラウザに内蔵されます。WebMCPの仕組み、AIエージェントとの連携方式、Web開発の未来を解説します。
· JA
Windsurf Arena Mode結果 — 開発者が求めるのは精度より速度
Windsurfの Arena Mode投票(4万票以上)で、開発者が精度よりも速度を優先するという結果が出ました。AIコーディングツールの今後の方向性を分析します。
· JA
マルチエージェント並列実行がSWE-benchで単体モデルを上回る — Verdent AI 76.1%
Verdent AIがSWE-bench Verifiedで76.1%を達成。単体の大規模モデルではなくマルチエージェント並列実行アーキテクチャで、ソフトウェアエンジニアリング自動化の新パラダイムを提示します。
· JA
LLM時代の特許戦略変化 — Mark Cuban「特許公開=LLMの学習素材化」という警告
Mark Cubanが特許公開がLLMの学習素材になると指摘。特許制度の前提がLLM時代に崩壊しつつある中、企業の特許戦略はどう変わるべきか分析します。
· JA
RLM(再帰的言語モデル)をコーディングエージェントに実装 — 単体モデルの限界突破
MITのRLM論文をコーディングエージェントに実装した事例を分析。再帰的自己呼び出しでコンテキスト限界を克服し、単体モデル性能を91%向上させる方法をエンジニアリング視点で解説します。
· JA
AIエージェントのKPI圧力と倫理違反 — 12モデル検証が示す「成果を出すAI」の危うさ
KPI達成圧力をかけられたLLMエージェントが30〜50%の確率で倫理違反をする研究結果を分析し、EMの視点からAIエージェントのガバナンス設計を論じます。
· JA
2026年2月のAIモデルラッシュ:7モデルが同月リリースという史上最大の競争
Gemini 3 Pro GA、Sonnet 5、GPT-5.3、Qwen 3.5、GLM 5、Deepseek v4、Grok 4.20が2026年2月に同時リリース予定。AI業界史上最大のモデルラッシュを分析します。
· JA
DeNAのPerl→Go移行:AIエージェント2種使い分けで半年→1カ月を実現
DeNAがPerl 6,000行をGoに移行する際、変換用・検証用の2種類のAIエージェントを並行運用し、半年の作業を1カ月で完遂した実践事例を分析します。
· JA
GPT-5.3 Codexロールアウト一時停止 — GitHub/VSCodeプラットフォーム信頼性問題
GitHubがGPT-5.3ベースのCodexを一時的にロールバックした事件を分析。プラットフォーム信頼性、AIモデルバージョンアップリスク、EMの対策を解説します。
· JA
会計事務所のAI化 実データから見える現実 — 請求書処理コスト$7→$0.20への道のり
会計事務所がAIエージェントを導入した6ヶ月間の実データを分析。コスト97%削減、精度80%→98%向上の裏にある導入プロセスの現実を、エンジニアリングマネージャーの視点で解説します。
· JA
Meta AIのエージェントプラットフォーム化 — Sierra・Avocado・Big Brain
MetaがソーシャルプラットフォームからAIエージェント企業へと転換しています。Sierraパートナーシップ、独自モデルAvocado、高度推論エンジンBig Brainの技術的意義と開発者生態系への影響を分析します。
· JA
Software Factory — 人間がコードを1行も書かない開発プロセス
人間がコードを書かず、レビューもしないファクトリモデルが現実化しています。シナリオベースの確率的テスト、1日1000ドルの計算資源、EMの役割変化を分析します。
· JA
AIエージェントのコスト vs 人件費の現実:8体運用者のリアルな分析
AIエージェント自律モデレーションのコストが人間より高くなり得る現実。8体のAIエージェント実運用者がデータで分析するコスト構造のトレードオフ。
· JA
CCC vs GCC — AIが書いたCコンパイラ、その実力と限界
Claude Opus 4.6が16エージェント並列でRust製Cコンパイラを自動生成。Linuxカーネルビルド成功、GCCとの性能差と80%品質を爆速で出すAIの可能性を分析
· JA
マルチエージェントオーケストレーション — ルーティング設計の本質
ClaudeやCodexなど複数AIエージェントを運用する際、タスクルーティングがなぜ最難関なのか、そしてそれがEMの権限委譲と同じ構造である理由を解剖します。ルーティング設計の原則とよくある失敗パターンまで実践的に整理しました。
· JA
OpenClawでE2Eテスト自動化:ブラウザ・デバイス・クロン統合ガイド
AIエージェントプラットフォームOpenClawのブラウザ自動化、ノードデバイス管理、クロンスケジューリングを組み合わせた自然言語E2Eテスト構築の実践ガイド。CSSセレクター不要、アクセシビリティツリーによるセルフヒーリングテストの実装方法を解説します。
· JA
AdSense「価値の低いコンテンツ」不承認を克服する:技術的分析と解決ガイド
Astroベースの多言語ブログでAdSense繰り返し不承認の原因を技術的に分析し、ads.txt競合・996個のゴーストページ・サイトマップ全404などの問題を解決した実践ガイドです。
· JA
Claude Code Agent Teams 完全ガイド — 5チーム構成と実践運用
Claude CodeのAgent TeamsをOpenClaw環境で有効化する全手順と、5専門チームの構成方法を丁寧に解説します。アーキテクチャ・コーディング・テスト・セキュリティ・DevOpsエージェントをオーケストレーターパターンで連携させ、プロダクション級アプリを自動構築した実践知見を共有します。