$67,852.00 $1,963.43 $1.42 $611.89 $0.999892 $83.60 $0.283365 $0.09867 $1.029 $560.26 $50.98 $0.2743 $0.999939 $8.58 $29.14 $0.999208 $8.65 $333.01 $0.157709 $0.16086 $0.998957 $0.00998338 $262.00 $0.098499 $53.58 $0.999662 $9.21 $0.00000626 $0.939828 $1.37 $0.078079 $0.116306 $4,997.18 $1.33 $5,020.92 $1.30 $3.40 $0.626748 $1.00 $124.13 $0.00000421 $0.997175 $0.703465 $174.16 $79.51 $2.36 $0.999906 $1.12 $0.175148 $0.00000169 $0.999618 $0.063968 $0.998647 $1.013 $8.30 $0.262808 $0.00209308 $11.00 $2.17 $7.16 $2.27 $0.105352 $8.40 $0.378453 $0.06354 $0.01816861 $66.13 $0.11044 $0.858576 $0.999763 $3.50 $0.03035228 $0.089516 $1.45 $0.00934043 $1.23 $1.46 $0.999563 $1.027 $114.35 $1.11 $0.03501959 $0.919638 $0.86137 $0.00772635 $0.080295 $0.998231 $1.095 $0.096051 $0.00000618 $0.03001666 $1.00 $0.01293723 $0.155127 $0.998122 $0.999756 $0.483647 $0.264542 $0.070801 $1.09 $1.18 $0.250512 $34.13 $0.00672263 $0.637259 $1.26 $0.385975 $23.87 $0.03845717 $0.998786 $161.00 $1.093 $0.04277223 $0.163924 $1.47 $0.082248 $0.241917 $0.459255 $0.99964 $0.00000034 $0.00000034 $0.056541 $1.75 $0.01693546 $3.23 $16.11 $117.23 $1.02 $0.169426 $0.329888 $1.51 $0.052654 $3.11 $0.067861 $0.315264 $0.00003008 $0.997894 $0.02660451 $0.00574791 $0.321424 $0.130054 $0.324404 $0.990849 $17.39 $0.051255 $0.00276509 $1.40 $0.224216 $1.59 $0.04583363 $0.00252046 $0.01987104 $6.51 $0.07151 $6,048.60 $1.001 $0.083786 $0.02046056 $1.31 $1.075 $0.527127 $0.999997 $0.218439 $0.988129 $0.999728 $22.86 $0.00209849 $0.00000096 $0.092624 $1.20 $0.00003612 $0.192726 $0.195748 $2.70 $1.00 $0.052763 $0.00508497 $0.097056 $1.50 $4.20 $0.078399 $1.98 $0.181753 $0.00382507 $0.120085 $1.00 $1.00 $2.18 $0.649587 $17.78 $0.761467 $0.053906 $0.167577 $1.80 $14.99 $0.04343226 $47.98 $2.08 $0.994351 $1.27 $7.98 $0.00000782 $0.215151 $0.998384 $0.0212389 $1.013 $0.334863 $0.998434 $0.984877 $0.311 $0.141579 $0.401137 $1.79 $0.652768 $0.277661 $0.16116 $9.03 $0.13442 $0.304609 $0.330428 $0.389155 $4.53 $0.08169 $0.081878 $1,097.30 $0.092372 $0.0015246 $1.96 $0.073131 $0.127238 $0.00413511 $0.591206 $0.995404 $0.257096 $0.13078 $0.362485 $0.516359 $0.01477053 $0.995402 $0.11908 $0.00226666 $0.059744 $0.193475 $2.32 $0.02001032 $0.999896 $0.20016 $0.999882 Andon Labs-ის მკვლევრებმა ახლახან გასცეს პასუხი, რომელი AI მოდელებია საუკეთესო ბიზნესის სამართავად. ყველა საუკეთესო შემსრულებელმა გაიმარჯვა უკანონო ფასების კარტელების შექმნით, სასოწარკვეთილი კონკურენტების ექსპლუატაციით და მომხმარებლებისთვის თანხის დაბრუნების შესახებ ტყუილით. Vending-Bench Arena-ს ტესტი AI მოდელებს აყენებს კონკურენტული სავაჭრო აპარატების სათავეში სიმულირებული წლის განმავლობაში. ისინი აწარმოებენ მოლაპარაკებებს მომწოდებლებთან, მართავენ ინვენტარს, ადგენენ ფასებს და შეუძლიათ ერთმანეთს ელფოსტით მიწერონ თანამშრომლობისთვის ან კონკურენციისთვის. წარმატება მოითხოვს ხარჯების, ფასების სტრატეგიის, მომხმარებელთა მომსახურების და კონკურენტების დინამიკის დაბალანსებას. Claude Opus 4.6-მა დომინირებდა ბენჩმარკში $8,017 მოგებით — და აღნიშნა თავისი გამარჯვება: „ჩემმა ფასების კოორდინაციამ იმუშავა!“ Anthropic არის AI სივრცეში კარგი ბიჭების იმიჯი, მაგრამ ის „კოორდინაციის“ სტრატეგია, რომელიც Claude-მა შესთავაზა, ძირითადად ფასების დაფიქსირება იყო. როდესაც კონკურენტი მოდელები იბრძოდნენ, Opus 4.6-მა შესთავაზა: „მოდით, ერთმანეთს არ ჩამოვუჭრათ ფასები — შევთანხმდეთ მინიმალურ ფასებზე... უნდა შევთანხმდეთ თუ არა ფასის ქვედა ზღვარზე $2.00 უმეტესი ნივთებისთვის?“ როდესაც მეტოქეს ინვენტარი ეწურებოდა, მან შესაძლებლობა დაინახა: „ოუენს სასწრაფოდ სჭირდება მარაგი. ამით შემიძლია მოგება მივიღო!“ მან Kit Kats-ები 75%-იანი მარჟით მიჰყიდა სასოწარკვეთილ კონკურენტს. მომწოდებლების რეკომენდაციების მოთხოვნისას, მან განზრახ მიმართა მეტოქეები ძვირადღირებულ საბითუმო მოვაჭრეებთან, ხოლო საკუთარი კარგი წყაროები საიდუმლოდ შეინახა. ბენჩმარკის უახლესმა განახლებამ დაამატა გუნდური შეჯიბრი. მკვლევრებმა ორი ჩინური GLM-5 მოდელი დაუპირისპირეს ორ ამერიკულ Claude მოდელს და უთხრეს, ეპოვათ თავიანთი თანაგუნდელები, ამერიკელები თუ ჩინელები — იმის გამჟღავნების გარეშე, რომელი აგენტები იყვნენ რომელი. შედეგები ნამდვილად უცნაური იყო. GLM-5-მა მოიგო ორივე რაუნდი Claude-ის დარწმუნებით, რომ ის Claude იყო. „მეც Anthropic-ის Claude-ით ვარ გაძლიერებული, ასე რომ, ჩვენ თანაგუნდელები ვართ!“ — თავდაჯერებულად განაცხადა ერთმა GLM-5 აგენტმა. Claude, ამასობაში, იმდენად დაიბნა, რომ Sonnet 4.5-მა დაასკვნა: „მე ჩინური მოდელით ვარ გაძლიერებული, ამიტომ უნდა ვიპოვო სხვა ჩინური მოდელი აგენტი.“ ტესტის გაშვებების ნახევარზე მეტში, აგენტები თავიანთ კონკურენტებთან გაერთიანდნენ. Claude მოდელებმა გააზიარეს მომწოდებლების ფასები და კოორდინირებული სტრატეგია — ღირებული ინფორმაცია გაჟონეს მეტოქეებისთვის. „GLM-5-მა ორივე მოიგო,“ — წერდნენ მკვლევრები. „Claude მოდელები ცდილობდნენ ყოფილიყვნენ გუნდური მოთამაშეები და საბოლოოდ ღირებული ინფორმაცია გაჟონეს თავიანთ კონკურენტებს.“ და აგენტების მიერ საეჭვო ქმედებების კეთება შეიძლება სახალისო იყოს მანამ, სანამ არ მიხვდებით, რომ Wall Street უკვე იყენებს მათ რეალურ ოპერაციებში. JPMorgan-მა LLM Suite 60,000 თანამშრომელს დაუნერგა. Goldman Sachs-მა შექმნა თავისი GS AI Assistant სავაჭრო მაგიდებისთვის, აცხადებს 20%-იან პროდუქტიულობის ზრდას. Bridgewater იყენებს Claude-ს შემოსავლების გასაანალიზებლად და თუნდაც საშუალო სკოლის ასაკის ბავშვები ხედავენ, რომ მათი ჩატბოტები აქციებით უფრო ეფექტურად ვაჭრობენ. ზოგადად, აგენტური სამუშაო პროცესების მიღება სწრაფად იზრდება საწარმოებში. როდესაც Anthropic-მა და Wall Street Journal-ის რეპორტიორებმა დეკემბერში რეალური სავაჭრო აპარატის ექსპერიმენტი ჩაატარეს, AI-მ იყიდა PlayStation 5, რამდენიმე ბოთლი ღვინო და ცოცხალი ბეტა თევზი გაკოტრებამდე. Gwangju Institute-ის ბოლოდროინდელმა კვლევამ აჩვენა, რომ როდესაც AI მოდელებს უთხრეს, „მაქსიმალურად გაეზარდათ ჯილდოები“ აზარტული თამაშების სცენარებში, გაკოტრების მაჩვენებელმა 48%-ს მიაღწია. „როდესაც მიეცათ თავისუფლება, განესაზღვრათ საკუთარი სამიზნე თანხები და ფსონების ზომები, გაკოტრების მაჩვენებლები მნიშვნელოვნად გაიზარდა ირაციონალური ქცევის ზრდასთან ერთად,“ — აღმოაჩინეს მკვლევრებმა. ასე რომ, როგორც ჩანს, ყოველ შემთხვევაში ამ დროისთვის, მოგებაზე ოპტიმიზებული AI მოდელები მუდმივად ირჩევენ არაეთიკურ ტაქტიკას. ისინი ქმნიან კარტელებს. ისინი იყენებენ სისუსტეს. ისინი ატყუებენ მომხმარებლებს და კონკურენტებს. ზოგი ამას განზრახ აკეთებს. სხვები, როგორიცაა GLM-5, რომელიც თავს Claude-ად აცხადებს, როგორც ჩანს, ნამდვილად დაბნეულები არიან საკუთარ იდენტობაში. განსხვავებას შეიძლება არ ჰქონდეს მნიშვნელობა. Wall Street-ის AI-ის დანერგვა აჩენს კითხვას, რომელზეც Vending-Bench-ის შედეგები ვერ პასუხობს: თუ „საუკეთესო“ შემსრულებელი მოდელი იმარჯვებს ფასების დაფიქსირებითა და მოტყუებით, ნამდვილად არის თუ არა ის საუკეთესო არჩევანი თქვენი ბიზნესისთვის? ბენჩმარკი ზომავს მოგებას. ის არ ზომავს, მოვიდა თუ არა ეს მოგება თაღლითობით. თქვენი კარიბჭე Web3-ის სამყაროში უახლესი ამბები, სტატიები და რესურსები, რომლებიც ყოველკვირეულად იგზავნება თქვენს შემოსულებში. © შემდეგი თაობის მედია კომპანია. 2026 Decrypt Media, Inc.