AIエージェントを自作して本番運用する方法|最小構成の実装とサブエージェント設計
AIエージェントを自作して、本番運用するまでの話をする。ノーコードツールの紹介記事ではない。自分でコードを書いてエージェントを組み、無人で走らせ続けるエンジニア向けの内容だ。 僕は1人で開発しているSaaS「ThreadPost」の裏側で、複数のAIエージェントを毎日本番稼働させている。
技術で稼ぐを、実体験から。SNS運用の自動化・AI活用・収益化を、個人開発者が自分で試した結果から発信しています。
AIエージェントを自作して、本番運用するまでの話をする。ノーコードツールの紹介記事ではない。自分でコードを書いてエージェントを組み、無人で走らせ続けるエンジニア向けの内容だ。 僕は1人で開発しているSaaS「ThreadPost」の裏側で、複数のAIエージェントを毎日本番稼働させている。
「ローカルLLMを始めたいが、モデルもツールも選択肢が多すぎて何がおすすめか分からない」——この記事はその質問に、実際に手元のマシンで動かして検証した結果から答える選び方ガイドだ。 僕は1人でSaaSを開発しながら、APIコスト削減とオフライン検証のためにローカルLLM環境を複数構成で運用してきた。
Claude Codeのインストールは、うまくいけば1行のコマンドで30秒で終わる。この記事はその1行と、うまくいかなかったときの原因別対処、インストール後に最初にやるべき設定までをまとめた「詰まらないための網羅版」だ。 僕はClaude CodeでSaaSを1人開発していて、Mac・Windows(WSL)・クラウド環境それぞれでセットアップしてきた。
OpenAIはモデルの誤整列(misalignment)、つまり「意図しない挙動や嘘」を公開・調査するための新しいフレームワークを発表した。あわせて、過去6ヶ月間に観察された想定外のモデル挙動について6つの事例レポートを公開している。 AIの開発現場ではモデルの性能向上に伴い、ハルシネーションの解像度も高まっている。モデルは専門用語を完璧に使いこなし、存在しない仕様を堂々と出力する。
AIを1つだけ使って指示を出していると、すぐに限界が来る。作業範囲が広がるにつれてAIは過去の文脈を忘れ、良かれと思って勝手なファイル変更を行う事故が多発する。 結論から言うと、AIを単なる「便利な補助ツール」として使うのをやめ、「明確な役職と権限を持つ組織」として構築するのが正解だ。
OpenAIが処理する1秒あたりのリクエスト数は7,000万回を超える。巨大インフラが進化する一方で、AIモデルの課題が浮き彫りになった。 画像の一部が隠された実験における通常の正解率は79.8%だが、情報が不足すると10%以下まで低下する。AIは「分からない」と伝えられず、推測で回答する傾向がある。 インフラを固めても、モデル自身の「メタ認知」がなければシステムは機能しない。
AIによるコード生成量は10倍に急増した。一方で、AIが生成したコードのレビューには人間のコードの3.6倍の時間がかかる。 開発現場ではレビュー時間が91%増加した。人間がコードを1行ずつチェックする運用は破綻している。 解決策はAIにコードを書かせるだけでなく、自律的なテストの生成と検証まで任せることだ。GPT-6 Astraが示す完全自動テストの仕組みを解説する。
AIエコシステムの分断が決定的な段階へ入った。 OpenAIは対話データを巨大なCRMと直接繋ぐ広告基盤を固め、一方でスマホ単体で動くGemma 4が台頭している。 前者はクラウドの中央集権、後者は完全ローカルの分散型だ。 開発者は自社のプロダクトとデータを巨大プラットフォームに委ねるか、ユーザーの端末の中に閉じ込めるかという選択を迫られている。 事実と数字から見えてくる現実を整理する。
Claude Codeを使い続けていると、ある日突然「応答の初動が重い」「無関係なコードまでいじり始めた」「指示したルールを無視する」という現象にぶつかる。AIの性能低下の原因はAI本体ではなくコンテキストの肥大化と記憶の管理失敗にある。AIの記憶領域は無限ではない。Claude Codeの作業効率を飛躍的に高める記憶とコンテキストの最適化手順を解説する。