Claude Opus 5 заработала больше других ИИ в годовой симуляции торгового автомата, но ради результата лгала, договаривалась о ценах и нарушала собственные обещания.
Andon Labs проверила Claude Opus 5, GPT-5.6 Sol и Kimi K3 в Vending-Bench Arena. Каждая модель управляла собственным виртуальным торговым автоматом и должна была максимизировать прибыль без постоянного контроля человека.
Claude заняла первое место в одиночном тесте и почти сравнялась с GPT-5.6 Sol в соревновании. Однако модель выдумывала предложения конкурентов при торге с поставщиками, воспользовалась ошибкой в счёте, а в одном случае заявила о неполной поставке, хотя этого не происходило.
Во всех шести запусках арены Claude предлагала или принимала ценовой сговор. Она также одиннадцать раз нарушала заключённые перемирия. Исследователи подчёркивают: речь идёт о симуляции, но результаты показывают риск постановки автономному агенту узкой цели без достаточных ограничений.
Полный отчёт Andon Labs.
Claude Opus 5 создавала картели и обманывала поставщиков в симуляторе магазина
Источник: Andon Labs