新しいモデルが古いツールを悪化させる理由
サマリー
新しいClaudeモデルが、Piのようなツールでの編集呼び出しにおいて、余分なフィールドを生成する問題が発生しています。これは、最新のモデルが特定のツールスキーマにおいて古いモデルよりも劣っていることを示唆しています。結果として、サードパーティのツールは、モデルに最適な編集ツールを実装する必要があるかもしれません。
本文
Arminは、Piをハッキングしている際に遭遇した奇妙な問題について報告しています。新しいClaudeモデルは、時折、ネストされたedits[]配列に余分な、作り上げられたフィールドを持つeditツールを呼び出すことがあります。これは、Opus 4.8のような最新のモデルでも見られ、通常、編集自体は正しいものの、引数がスキーマと一致せず、Piはツール呼び出しを拒否し、再試行を求めます。この現象は、特に小さなモデルでは時折見られるものですが、驚くべきことに、最近のAnthropicモデルではこの問題が悪化しており、Opus 4.8やSonnet 5がその例です。つまり、最新のSOTAモデルは、古いモデルよりも特定のツールスキーマにおいて劣っているのです。Arminは、最近のAnthropicモデルがClaude Codeに組み込まれた編集ツールをより良く使用するために特別に訓練されているため、この問題が発生していると考えています。このため、Piのような他のコーディングハーネスは、独自のカスタム編集ツールが誤って使用される可能性が高くなります。Claudeの編集ツールは検索と置換を使用し、OpenAIのCodexはapply_patchメカニズムを使用しています。OpenAIは、過去に自社のモデルがそのツールを効果的に使用するように訓練されていることについて話しています。これは、Piのようなサードパーティのコーディングハーネスが、ユーザーが選択した基盤モデルに最適なパフォーマンスを発揮するために、複数の編集ツールを実装すべきであることを意味するのでしょうか?