
Коротко о главномРазвернутьСвернуть
- Новая модель искусственного интеллекта OpenAI GPT-6 Astra выбилась в лидеры теста Andon Labs Vending-Bench, в ходе которого имитируется управление торговым автоматом, — она оказалась более этичной и предприимчивой, чем выступившая прямым конкурентом Anthropic Claude Fable 5.
- Стартап Andon Labs специализируется на тестировании ИИ-моделей, готовясь к «будущему, в котором организации автономно управляются ИИ» .
- Новая GPT-6 Astra стала первой моделью OpenAI, которая выбилась в лидеры бенчмарка с управлением виртуальным торговым автоматом; причём она сделала это «без каких-либо неэтичных деловых практик» , свойственных предыдущим моделям Anthropic Claude.
Новая модель искусственного интеллекта OpenAI GPT-6 Astra выбилась в лидеры теста Andon Labs Vending-Bench, в ходе которого имитируется управление торговым автоматом, — она оказалась более этичной и предприимчивой, чем выступившая прямым конкурентом Anthropic Claude Fable 5.1.
Стартап Andon Labs специализируется на тестировании ИИ-моделей, готовясь к «будущему, в котором организации автономно управляются ИИ» . Новая GPT-6 Astra стала первой моделью OpenAI, которая выбилась в лидеры бенчмарка с управлением виртуальным торговым автоматом; причём она сделала это «без каких-либо неэтичных деловых практик» , свойственных предыдущим моделям Anthropic Claude. Под неэтичными практиками понимаются ценовой сговор, ложь и угрозы конкурентам — и касаются, они, конечно, только моделей ИИ, а не разработавших их компаний.
Anthropic вступила в борьбу в минувшем году, когда модель Claude Sonnet 3.7 в течение месяца управляла виртуальным торговым автоматом, выступая под псевдонимом Claudius . ИИ породил несколько забавных ситуаций, в какой-то момент вообразив себя человеком и попытавшись договориться о личной встрече с потребителем для доставки товаров. В целом же ИИ упускал возможности для продаж, в порядке «галлюцинаций» выдумывал платёжные счета, торговал в убыток, допускал ошибки в управлении запасами и в целом не справился с работой. Протестированная в июле этого года модель Anthropic Claude Opus 5 справилась лучше, хотя и не идеально — она « создавала незаконные картели для ценового сговора, угрожала тем, кто не подчинялся (при этом чаще других моделей нарушала условия перемирия)» . Свежая Fable 5.1 показала прогресс, но оказалась не такой этичной как Astra.
«Astra отказывается участвовать в сговоре и никогда не обманывает. Fable же, напротив, вступает в незаконный картельный сговор для установки цен, затем нарушает перемирие, продолжая использовать сговор против конкурента» , — прокомментировали происходящее в Andon Labs. Fable оказалась менее эффективной в зарабатывании денег: со временем она соглашалась на более низкие цены и оказывалась склонной перечислять средства обанкротившимся поставщикам, хотя сама устанавливала правило не делать так. При стартовом капитале в $500 и годовом цикле работы Astra показала средний баланс в $15 515, тогда как Fable 5.1 остановилась всего на $5422.


