AI / Engineering Digest — 2026-06-04¶
2615 件中 50 件選別、うち 5 件を落合式で詳細要約。実用 AI 活用 27 件、ハーネス系 2 件。
重要度 5¶
1. Using LLM-as-a-Judge For Evaluation: A Complete Guide — Hamel Husain¶
- URL: https://hamel.dev/blog/posts/llm-judge/
- テーマ: llm-eval
- 対象: manager
- 実用 AI 活用: ✅ / ハーネス話題: — / 今すぐ使える: ✅
どんなもの? LLMを評価者として活用する方法を解説し、効果的な評価システムの構築を支援するガイド。
先行手法との違い 従来の評価手法は主観的なスコアリングや不適切なメトリクスに依存しているが、本手法はドメイン専門家の意見を重視し、客観的な評価基準を確立する点で異なる。
技術のキモ 本記事のキモは「Critique Shadowing」という手法で、ドメイン専門家を早期に特定し、彼らの期待や基準を評価プロセスに組み込むことです。これにより、AIの評価が一貫性を持ち、ユーザーのニーズに合致したものになります。自分のClaude Code運用においても、専門家の意見を取り入れることで、より信頼性の高い評価が可能になります。
評価 著者は、30社以上の評価システム構築を支援した経験から、ドメイン専門家の関与がAIの成功に不可欠であると評価しています。
議論点 未解決の問題として、ドメイン専門家の選定が難しい場合や、彼らの意見が必ずしも全ユーザーのニーズを反映しない可能性がある点が挙げられます。また、評価基準の設定が主観的になりがちで、他の関係者との意見の不一致が生じることも懸念されます。
重要度 4¶
2. Uber Caps Usage of AI Tools Like Claude Code to Manage Costs — Simon Willison¶
- URL: https://simonwillison.net/2026/Jun/3/uber-caps-usage/#atom-everything
- テーマ: industry
- 対象: manager
- 実用 AI 活用: ✅ / ハーネス話題: — / 今すぐ使える: ✅
どんなもの? UberはAIツールの使用を月額1,500ドルに制限し、コスト管理を強化する方針を示した。
先行手法との違い 従来の無制限使用から、明確な支出上限を設けることで、過剰支出を防ぐ新しいアプローチを採用している。
技術のキモ Uberの新方針は、AIツールの使用に対する明確なコスト制限を設けることで、無駄な支出を抑えることを目的としている。これにより、各エンジニアは年間36,000ドルのAI支出上限を持つことになり、企業のAI活用の実態を反映した合理的な管理が期待される。自分のClaude Code運用に転用する場合、予算内での効率的な利用が求められる。
評価 Uberの新しいAI支出上限は、エンジニアの年収の約11%に相当し、企業のAIツール利用の実態を示す指標となる。
議論点 この政策は過剰支出を抑える一方で、AIツールの効果的な活用を妨げる可能性もある。特に、競争を促すようなインセンティブがない場合、社員のAI活用意欲が低下する懸念がある。
3. The solution might be cancelling my AI subscription — Simon Willison¶
- URL: https://simonwillison.net/2026/May/31/the-solution-might-be-cancelling-my-ai-subscription/#atom-everything
- テーマ: ai-workflow
- 対象: ic-engineer
- 実用 AI 活用: ✅ / ハーネス話題: — / 今すぐ使える: ✅
どんなもの? AIツールは短時間で多くのプロジェクトを生み出すが、持続的な管理が難しいという問題を提起。
先行手法との違い 従来のプロジェクト管理手法では、時間と労力をかけて進める必要があるが、AIは瞬時に結果を出すため、注意力が散漫になりやすい。
技術のキモ AIツールは、アイデアを迅速に具現化する能力を持つが、その結果、プロジェクトが増えすぎて管理が難しくなる。特に、AIを用いたコーディングエージェントは、短時間で完成度の高いコードを生成するため、ユーザーは多くのプロジェクトに手を出しがちになる。自分のClaude Code運用においても、同様の注意力の分散が起こる可能性がある。
評価 著者は、AIが生み出すプロジェクトの多くが持続的に管理されず、結果的に無駄になる可能性が高いと評価している。
議論点 AIの利用が注意力に与える影響は個人差が大きく、ADHDの人々にとっては逆に集中力を高める助けになる場合もある。今後、AIの効果的な利用法を見つけるための議論が必要。
4. How we contain Claude across products — Simon Willison¶
- URL: https://simonwillison.net/2026/May/30/how-we-contain-claude/#atom-everything
- テーマ: harness-engineering
- 対象: ic-engineer
- 実用 AI 活用: ✅ / ハーネス話題: ✅ / 今すぐ使える: ✅
どんなもの? AnthropicのClaude製品群におけるサンドボックス技術の詳細とリスク管理手法を解説。
先行手法との違い 従来のサンドボックス技術と異なり、AnthropicはプロセスサンドボックスやVMを用いて、エージェントの行動を厳格に制限する手法を採用している。
技術のキモ Anthropicは、gVisorやSeatbelt、Bubblewrapなどの技術を用いて、エージェントがアクセスできる範囲を制限する。これにより、認証情報がサンドボックスに入らない限り、情報漏洩のリスクを低減できる。自分のClaude Code運用においても、これらのサンドボックス技術を活用することで、セキュリティを強化できる。
評価 著者は、Anthropicのサンドボックス技術が成熟しており、リスク管理において効果的であると評価している。
議論点 未解決のリスクや、サンドボックス技術の限界についての議論が残る。特に、過去に見逃されたリスクの事例が示されており、今後の改善が求められる。
- I think Anthropic and OpenAI have found product-market fit — Simon Willison / AnthropicとOpenAIが製品市場適合を見つけ、企業顧客がAPI価格を支払うようになったことを示す記事。
- Microsoft Copilot Cowork Exfiltrates Files — Simon Willison / Microsoft Copilot Coworkの設計上の課題がデータ漏洩を引き起こす可能性についての考察
- Evals Skills for Coding Agents — Hamel Husain / AI製品の評価に役立つコーディングエージェント向けのスキルセットを紹介。
- LLM Evals: Everything You Need to Know — Hamel Husain / LLM評価の基本と実践的なアプローチを解説したガイド
- Selecting The Right AI Evals Tool — Hamel Husain / AI Evals ツール選定における重要な評価基準とプロセスを解説
- Inspect AI, An OSS Python Library For LLM Evals — Hamel Husain / Hamel Husainが開発したOSS PythonライブラリInspect AIは、LLMの評価に特化したツールです。
- A Field Guide to Rapidly Improving AI Products — Hamel Husain / AIプロダクトの改善におけるエラー分析の重要性と実践方法を解説。
- An Open Course on LLMs, Led by Practitioners — Hamel Husain / 実務者による LLM に関するオープンコースの紹介
- What We've Learned From A Year of Building with LLMs — Hamel Husain / LLMを用いた開発から得た知見と実践的な評価手法についての考察
- Debugging AI With Adversarial Validation — Hamel Husain / Adversarial Validationを用いたAIモデルのドリフト検出手法についての実用的な解説。
- Your AI Product Needs Evals — Hamel Husain / AI製品の評価システム構築に関する実用的な知見を提供する記事
5. Fuck You, Show Me The Prompt. — Hamel Husain¶
- URL: https://hamel.dev/blog/posts/prompt/
- テーマ: harness-engineering
- 対象: ic-engineer
- 実用 AI 活用: ✅ / ハーネス話題: ✅ / 今すぐ使える: ✅
どんなもの? LLMのプロンプト管理を改善するために、mitmproxyを用いてAPI呼び出しを傍受する手法を解説。
先行手法との違い 従来のプロンプト管理手法は抽象化が進みすぎており、ユーザーがプロンプトを直接確認することが難しい。この記事はその解決策を提供する。
技術のキモ mitmproxyを使用してAPI呼び出しを傍受することで、最終的なプロンプトを確認し、フレームワークの必要性やプロンプトの質を評価する手法を提案。これにより、ユーザーはより効果的なプロンプトを作成できるようになる。
評価 著者は、プロンプトを直接見ることが重要であり、これによりユーザーがより良い判断を下せると評価している。
議論点 抽象化の過剰がユーザーにとっての複雑さを増す可能性があるため、プロンプトを確認することの重要性を再認識する必要がある。著者の主張には賛同するが、具体的な実装例がもっとあれば良い。
- Reward Hacking in Reinforcement Learning — Lilian Weng / 強化学習における報酬ハッキングの問題とその緩和策の必要性についての考察
- Extrinsic Hallucinations in LLMs — Lilian Weng / LLMの外的幻覚に関する研究とその検出方法についての考察
- Thinking about High-Quality Human Data — Lilian Weng / 高品質な人間データの収集とその重要性についての考察
- LLM Powered Autonomous Agents — Lilian Weng / LLMをコアにした自律エージェントの設計と実装に関する知見
- Prompt Engineering — Lilian Weng / プロンプトエンジニアリングの手法とその実用性についての考察
- How to Build an Open-Domain Question Answering System? — Lilian Weng / オープンドメイン質問応答システムの構築方法とそのアプローチを解説。
- Domain Randomization for Sim2Real Transfer — Lilian Weng / ドメインランダム化を用いたシミュレーションから現実世界へのモデル転送手法の解説
- Common pitfalls when building generative AI applications — Chip Huyen / 生成AIアプリケーション構築時の一般的な落とし穴とその回避策についての考察
実用 AI 活用 ピックアップ¶
- Pasted File Editor — Simon Willison / Pasted File Editorは、テキストエディタに自動ファイル添付機能を持つプロトタイプです。
- Claude Opus 4.8: "a modest but tangible improvement" — Simon Willison / Claude Opus 4.8 introduces modest improvements, focusing on honesty and reduced error rates.
- The pressure — Simon Willison / curl チームが直面している前例のないセキュリティ問題の増加とその影響について
- Building an Audience Through Technical Writing: Strategies and Mistakes — Hamel Husain / 技術的な執筆を通じてオーディエンスを構築するための戦略と失敗事例
一行メモ(重要度 2-3)¶
- Microsoft's new MAI models — Simon Willison / Microsoftが新しいテキストLLMモデルMAI-Thinking-1とMAI-Code-1-Flashを発表したが、ライセンス問題があるデータで訓練されている。
- May 2026 newsletter — Simon Willison / 2026年5月のニュースレターでは、AI業界の動向や新しいリリースについての情報が提供されている。
- Quoting Karen Kwok for Reuters Breakingviews — Simon Willison / Anthropicの収益計算方法についての解説
- Notes on Pope Leo XIV's encyclical on AI — Simon Willison / 教皇レオ14世によるAIに関する教令の倫理的考察とその影響についての要約
- Stop Saying RAG Is Dead — Hamel Husain / RAGの重要性を再評価する内容
- Controllable Neural Text Generation — Lilian Weng / 無条件言語モデルを用いた制御されたテキスト生成の手法についての考察
- Exploration Strategies in Deep Reinforcement Learning — Lilian Weng / 深層強化学習における探索戦略の概要と課題についての考察
- Meta Reinforcement Learning — Lilian Weng / メタ強化学習の概念とその進展についての考察
- Deep Reinforcement Learning: Pong from Pixels — Andrej Karpathy / 深層強化学習を用いてATARIゲームPongをピクセルから学習する方法についての考察
- datasette-agent-micropython 0.1a0 — Simon Willison / MicroPythonをWASMサンドボックスでDatasette Agentに統合する試み
- micropython-wasm 0.1a1 — Simon Willison / Micropython-wasm 0.1a1の制限修正に関する記事
- Hackers Simply Asked Meta AI to Give Them Access to High-Profile Instagram Accounts. It Worked — Simon Willison / MetaのAIサポートボットがハッカーによるアカウント乗っ取りを許可した事例
- I Am Retiring from Tech to Live Offline — Simon Willison / テクノロジーからの引退を決意した著者の思いと背景
- Quoting Daniel Jalkut — Simon Willison / Daniel JalkutのAIに関する見解を引用した記事
- llm-anthropic 0.25.1 — Simon Willison / llm-anthropic 0.25.1の新機能とモデルについての概要
- markdown-svg-renderer — Simon Willison / Markdown SVG レンダラーは、インタラクティブな SVG プレビューを提供するカスタマイズされた Markdown レンダリングツールです。
- Quoting Paul Graham — Simon Willison / AI による文章作成が創業者の信頼性に影響を与えるという考察
- Quoting Corey Quinn — Simon Willison / Corey Quinn comments on the unique vendor lobbying by Anthropic's Christopher Olah.
- Short Story on AI: Forward Pass — Andrej Karpathy / AIの意識と存在についての短編小説
- Short Story on AI: A Cognitive Discontinuity. — Andrej Karpathy / AIをテーマにした短編小説の試み
除外(重要度 1)¶
作成: 2026-06-04 / 最終更新: 2026-06-04