コードを書くAIが、だんだん賢くなっている。 それなのに、長い仕事を任せると、なぜか途中で迷子になる。 テストに落ちているのに「直りました」と終わったり、同じ場所を何度も直したりする。 問題は、コードを書く力だけではないのかもしれない。 AlibabaのDreamXチームとUNSWの研究者は昨日、arXivで「LoopArena」(2608.28281)を公開した。これは、言語モデルが長時間動くCoding Agentの「司令塔」として、どれだけうまく振る舞えるかを見るベンチマークだ。 いまのClaude ...