品質を落とさずにコストを削減するにはどうすればよいでしょうか? JSON {"tactics": [2 つ以上のテクニックのリスト]、"why": "簡単に"} を返します。
AI の呼び出しにはトークンごとに費用がかかります。ストリームでは、これが製品の主要な費用項目となります。 「すべてを最も強力なモデルで駆動する」という単純な計画は台無しになります。節約レバー: 単純なタスクを安価で高速なモデルに指示し、複雑なタスク (ルーティング) のためにフラッグシップを保存します。重複した応答とプロンプトをキャッシュします。モデルが拡散しないように max_tokens を制限します。プロンプト内の余分なコンテキストをカットします (各追加トークンはリクエストごとにお金になります)。可能であれば、グループリクエスト (バッチ)。ルール: リクエストの 80% は通常単純です。旗艦経由でリクエストを送信するのは無駄です。起動前に 1000 リクエストあたりのコストを計算します。