AIラボはペリカンマキシングを行っているのか?
サマリー
ダイラン・カスティーロの研究により、AIラボがペリカンが自転車に乗る絵を描く能力に特別な優位性はないことが示されました。テストしたモデル間での違いはほとんどなく、全体的にペリカンや自転車の描写は他の動物や乗り物と同程度でした。特に目立った結果は得られず、GLM-5.2がわずかに優れている程度でした。
本文
ダイラン・カスティーロによる素晴らしい研究が、AIラボが意図的にペリカンが自転車に乗っている絵を描くようにモデルを訓練しているのかという、よく考えられる疑問に深く切り込んでいます。彼は8種類の動物と6種類の乗り物を組み合わせた48のプロンプトを用意し、7つの異なるモデル(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)でそれぞれ3回テストしました。結果の評価にはGPT-5.6 LunaとGemini 3.1 Flash-Liteを使用しました。テストの結果、ペリカンが自転車に乗っているシーンは他の動物や乗り物と比べて特に優れているわけではなく、ペリカンや自転車の描写においても特に優れた結果は得られませんでした。GLM-5.2が最も近い結果を示しましたが、その効果は小さく、重要ではないとされています。