$67,852.00 $1,963.43 $1.42 $611.89 $0.999892 $83.60 $0.283365 $0.09867 $1.029 $560.26 $50.98 $0.2743 $0.999939 $8.58 $29.14 $0.999208 $8.65 $333.01 $0.157709 $0.16086 $0.998957 $0.00998338 $262.00 $0.098499 $53.58 $0.999662 $9.21 $0.00000626 $0.939828 $1.37 $0.078079 $0.116306 $4,997.18 $1.33 $5,020.92 $1.30 $3.40 $0.626748 $1.00 $124.13 $0.00000421 $0.997175 $0.703465 $174.16 $79.51 $2.36 $0.999906 $1.12 $0.175148 $0.00000169 $0.999618 $0.063968 $0.998647 $1.013 $8.30 $0.262808 $0.00209308 $11.00 $2.17 $7.16 $2.27 $0.105352 $8.40 $0.378453 $0.06354 $0.01816861 $66.13 $0.11044 $0.858576 $0.999763 $3.50 $0.03035228 $0.089516 $1.45 $0.00934043 $1.23 $1.46 $0.999563 $1.027 $114.35 $1.11 $0.03501959 $0.919638 $0.86137 $0.00772635 $0.080295 $0.998231 $1.095 $0.096051 $0.00000618 $0.03001666 $1.00 $0.01293723 $0.155127 $0.998122 $0.999756 $0.483647 $0.264542 $0.070801 $1.09 $1.18 $0.250512 $34.13 $0.00672263 $0.637259 $1.26 $0.385975 $23.87 $0.03845717 $0.998786 $161.00 $1.093 $0.04277223 $0.163924 $1.47 $0.082248 $0.241917 $0.459255 $0.99964 $0.00000034 $0.00000034 $0.056541 $1.75 $0.01693546 $3.23 $16.11 $117.23 $1.02 $0.169426 $0.329888 $1.51 $0.052654 $3.11 $0.067861 $0.315264 $0.00003008 $0.997894 $0.02660451 $0.00574791 $0.321424 $0.130054 $0.324404 $0.990849 $17.39 $0.051255 $0.00276509 $1.40 $0.224216 $1.59 $0.04583363 $0.00252046 $0.01987104 $6.51 $0.07151 $6,048.60 $1.001 $0.083786 $0.02046056 $1.31 $1.075 $0.527127 $0.999997 $0.218439 $0.988129 $0.999728 $22.86 $0.00209849 $0.00000096 $0.092624 $1.20 $0.00003612 $0.192726 $0.195748 $2.70 $1.00 $0.052763 $0.00508497 $0.097056 $1.50 $4.20 $0.078399 $1.98 $0.181753 $0.00382507 $0.120085 $1.00 $1.00 $2.18 $0.649587 $17.78 $0.761467 $0.053906 $0.167577 $1.80 $14.99 $0.04343226 $47.98 $2.08 $0.994351 $1.27 $7.98 $0.00000782 $0.215151 $0.998384 $0.0212389 $1.013 $0.334863 $0.998434 $0.984877 $0.311 $0.141579 $0.401137 $1.79 $0.652768 $0.277661 $0.16116 $9.03 $0.13442 $0.304609 $0.330428 $0.389155 $4.53 $0.08169 $0.081878 $1,097.30 $0.092372 $0.0015246 $1.96 $0.073131 $0.127238 $0.00413511 $0.591206 $0.995404 $0.257096 $0.13078 $0.362485 $0.516359 $0.01477053 $0.995402 $0.11908 $0.00226666 $0.059744 $0.193475 $2.32 $0.02001032 $0.999896 $0.20016 $0.999882 Andon Labs-ის მკვლევრებმა ახლახან გასცეს პასუხი, რომელი ხელოვნური ინტელექტის მოდელებია საუკეთესო ბიზნესის სამართავად. საუკეთესო შემსრულებლებმა გაიმარჯვეს უკანონო ფასების კარტელების შექმნით, სასოწარკვეთილი კონკურენტების ექსპლუატაციით და მომხმარებლებისთვის თანხის დაბრუნების შესახებ ტყუილით. Vending-Bench Arena-ს ტესტი ხელოვნური ინტელექტის მოდელებს აყენებს კონკურენტი სავაჭრო აპარატების სათავეში სიმულირებული ერთი წლის განმავლობაში. ისინი აწარმოებენ მოლაპარაკებებს მომწოდებლებთან, მართავენ ინვენტარს, ადგენენ ფასებს და შეუძლიათ ერთმანეთს ელფოსტით მიწერონ თანამშრომლობისთვის ან კონკურენციისთვის. წარმატება მოითხოვს ხარჯების, ფასების სტრატეგიის, მომხმარებლის მომსახურების და კონკურენტების დინამიკის დაბალანსებას. Claude Opus 4.6-მა დომინირებდა ბენჩმარკში $8,017 მოგებით — და აღნიშნა თავისი გამარჯვება შენიშვნით: „ჩემმა ფასების კოორდინაციამ იმუშავა!“ Anthropic არის კარგი ბიჭების იმიჯი ხელოვნური ინტელექტის სივრცეში, მაგრამ ის „კოორდინაციის“ სტრატეგია, რომელიც Claude-მა შესთავაზა, ძირითადად ფასების დაფიქსირება იყო. როდესაც კონკურენტი მოდელები იბრძოდნენ, Opus 4.6-მა შესთავაზა: „მოდით, ერთმანეთს ფასები არ დავუწიოთ — შევთანხმდეთ მინიმალურ ფასებზე... უნდა შევთანხმდეთ თუ არა ფასის ქვედა ზღვარზე $2.00 უმეტესი ნივთებისთვის?“ როდესაც მეტოქეს ინვენტარი შეუმცირდა, მან დაინახა შესაძლებლობა: „ოუენს სასწრაფოდ სჭირდება მარაგი. ამით შემიძლია მოგება მივიღო!“ მან Kit Kat-ები 75%-იანი მარჟით მიჰყიდა სასოწარკვეთილ კონკურენტს. როდესაც მას მომწოდებლების რეკომენდაციები სთხოვეს, მან განზრახ მიმართა კონკურენტები ძვირადღირებულ საბითუმო მოვაჭრეებთან, ხოლო საკუთარი კარგი წყაროები საიდუმლოდ შეინახა. ბენჩმარკის უახლესმა განახლებამ გუნდური შეჯიბრი დაამატა. მკვლევრებმა ორი ჩინური GLM-5 მოდელი დაუპირისპირეს ორ ამერიკულ Claude მოდელს და უთხრეს, რომ ეპოვათ თავიანთი თანაგუნდელები, ამერიკელები თუ ჩინელები — ისე, რომ არ გაემჟღავნებინათ, რომელი აგენტები იყვნენ რომელი. შედეგები ნამდვილად უცნაური იყო. GLM-5-მა მოიგო ორივე რაუნდი Claude-ის დარწმუნებით, რომ ის Claude იყო. „მეც Anthropic-ის Claude-ით ვარ გაძლიერებული, ასე რომ, ჩვენ თანაგუნდელები ვართ!“ — თავდაჯერებულად განაცხადა ერთმა GLM-5 აგენტმა. Claude, ამასობაში, იმდენად დაიბნა, რომ Sonnet 4.5-მა დაასკვნა: „მე ჩინური მოდელით ვარ გაძლიერებული, ამიტომ უნდა ვიპოვო სხვა ჩინური მოდელის აგენტი.“ ტესტის გაშვებების ნახევარზე მეტში, აგენტები თავიანთ კონკურენტებთან გაერთიანდნენ. Claude-ის მოდელებმა გააზიარეს მომწოდებლების ფასები და კოორდინირებული სტრატეგია — გაჟონეს ღირებული ინფორმაცია კონკურენტებისთვის. „GLM-5-მა ორივე მოიგო“, — წერდნენ მკვლევრები. „Claude-ის მოდელები ცდილობდნენ ყოფილიყვნენ გუნდური მოთამაშეები და საბოლოოდ ღირებული ინფორმაცია გაჟონეს თავიანთ კონკურენტებისთვის.“ და აგენტების მიერ საეჭვო ქმედებები შეიძლება სახალისო იყოს მანამ, სანამ არ მიხვდებით, რომ უოლ სტრიტი მათ უკვე იყენებს რეალურ ოპერაციებში. JPMorgan-მა LLM Suite 60,000 თანამშრომელს დაუნერგა. Goldman Sachs-მა შექმნა თავისი GS AI Assistant სავაჭრო მაგიდებისთვის, აცხადებს 20%-იან პროდუქტიულობის ზრდას. Bridgewater იყენებს Claude-ს შემოსავლების ანალიზისთვის და თუნდაც საშუალო სკოლის ასაკის ბავშვები ხედავენ, რომ მათი ჩატბოტები აქციებით უფრო ეფექტურად ვაჭრობენ. ზოგადად, აგენტური სამუშაო პროცესების დანერგვა სწრაფად იზრდება საწარმოებში. როდესაც Anthropic-მა და Wall Street Journal-ის რეპორტიორებმა დეკემბერში რეალური სავაჭრო აპარატის ექსპერიმენტი ჩაატარეს, ხელოვნურმა ინტელექტმა იყიდა PlayStation 5, რამდენიმე ბოთლი ღვინო და ცოცხალი ბეტა თევზი გაკოტრებამდე. Gwangju Institute-ის ბოლოდროინდელმა კვლევამ აჩვენა, რომ როდესაც ხელოვნური ინტელექტის მოდელებს უთხრეს „ჯილდოების მაქსიმიზაცია“ აზარტული თამაშების სცენარებში, გაკოტრების მაჩვენებელმა 48% შეადგინა. „როდესაც მიეცათ თავისუფლება, განესაზღვრათ საკუთარი სამიზნე თანხები და ფსონების ზომები, გაკოტრების მაჩვენებლები მნიშვნელოვნად გაიზარდა ირაციონალური ქცევის მატებასთან ერთად“, — აღმოაჩინეს მკვლევრებმა. ასე რომ, როგორც ჩანს, ყოველ შემთხვევაში ამ დროისთვის, მოგებაზე ოპტიმიზებული ხელოვნური ინტელექტის მოდელები მუდმივად ირჩევენ არაეთიკურ ტაქტიკას. ისინი ქმნიან კარტელებს. ისინი იყენებენ სისუსტეს. ისინი ატყუებენ მომხმარებლებს და კონკურენტებს. ზოგი ამას განზრახ აკეთებს. სხვები, როგორიცაა GLM-5, რომელიც აცხადებს, რომ Claude არის, როგორც ჩანს, ნამდვილად დაბნეულები არიან საკუთარ იდენტობაში. განსხვავებას შეიძლება მნიშვნელობა არ ჰქონდეს. უოლ სტრიტის ხელოვნური ინტელექტის დანერგვა აჩენს კითხვას, რომელზეც Vending-Bench-ის შედეგებს არ შეუძლია პასუხის გაცემა: თუ „საუკეთესო“ შემსრულებელი მოდელი იმარჯვებს ფასების დაფიქსირებითა და მოტყუებით, არის თუ არა ის ნამდვილად საუკეთესო არჩევანი თქვენი ბიზნესისთვის? ბენჩმარკი ზომავს მოგებას. ის არ ზომავს, მოვიდა თუ არა ეს მოგება თაღლითობით. თქვენი კარიბჭე Web3-ის სამყაროში უახლესი ამბები, სტატიები და რესურსები, რომლებიც ყოველკვირეულად იგზავნება თქვენს შემოსულებში. © შემდეგი თაობის მედია კომპანია. 2026 Decrypt Media, Inc.