OpenAI ამბობს, რომ AI კოდირების უნარის გასაზომად გამოყენებული ბენჩმარკი „დაბინძურებულია“ — აი, რატომ $67,983.00 $2,058.40 $1.43 $626.12 $0.999902 $87.47 $0.286731 $0.099633 $1.031 $50.84 $0.29324 $501.71 $0.999896 $8.80 $28.26 $0.174096 $9.22 $347.38 $0.999246 $0.16253 $0.999608 $0.00949096 $0.101664 $56.28 $1.001 $249.48 $9.34 $0.950979 $0.00000613 $0.077992 $0.114401 $1.29 $5,160.86 $1.57 $3.98 $5,195.59 $1.36 $0.607919 $1.00 $1.12 $184.68 $0.997269 $114.74 $0.705577 $0.00000403 $78.12 $1.00 $0.070215 $2.24 $0.168305 $0.999725 $0.00000163 $1.13 $8.97 $0.999291 $0.270464 $2.40 $0.111348 $11.00 $0.406963 $8.65 $7.10 $0.00182532 $0.059518 $1.93 $0.01697057 $63.98 $0.110911 $0.852688 $0.03149748 $1.001 $0.0097499 $3.49 $0.090379 $1.24 $0.762398 $1.00 $1.002 $1.46 $114.41 $0.959968 $1.027 $1.12 $0.03506122 $1.84 $0.00769265 $0.080228 $0.03385978 $0.099702 $1.096 $0.9989 $0.159356 $0.0000063 $1.00 $30.21 $0.291229 $0.01285525 $0.999331 $0.260963 $0.070498 $1.087 $1.18 $0.999838 $0.69978 $0.00712328 $35.17 $1.32 $0.393646 $0.04674122 $166.96 $0.52017 $1.00 $1.49 $0.165157 $0.251465 $0.085216 $1.036 $0.03436628 $0.999976 $0.377524 $130.12 $1.019 $0.00000034 $0.00000033 $0.05664 $16.27 $3.21 $1.58 $0.438961 $3.21 $0.01624082 $0.052804 $0.070393 $0.341348 $0.32407 $0.00602489 $0.0272005 $0.998372 $0.00002981 $17.47 $0.320975 $0.235167 $0.98394 $0.078088 $1.42 $0.050891 $0.122746 $1.59 $0.00269349 $6.43 $0.134625 $0.00246619 $0.02238892 $0.04430104 $0.999878 $0.086059 $1.075 $1.33 $1.79 $0.09788 $1.00 $0.985569 $0.999937 $1.075 $1.29 $0.212117 $0.00214532 $0.500845 $22.79 $0.00000098 $10.18 $5,275.20 $0.097452 $0.00003619 $2.80 $0.196077 $0.054105 $0.858229 $0.19699 $0.098294 $1.00 $0.18827 $0.02008658 $0.078788 $4.17 $0.00492173 $18.57 $1.00 $0.00376947 $0.116429 $1.89 $1.00 $0.171503 $0.054621 $2.13 $0.02313555 $0.621363 $1.80 $0.02002116 $3.48 $2.02 $48.00 $0.995813 $0.04178024 $0.00000789 $1.26 $0.334966 $0.998184 $0.998445 $0.147448 $0.41481 $0.169965 $1.012 $0.303502 $0.64818 $0.136606 $0.624621 $0.095268 $0.082157 $4.53 $0.131921 $0.262368 $1,096.64 $0.074016 $0.079228 $0.312886 $0.287112 $11.46 $0.00149065 $0.251516 $0.360278 $0.130718 $0.220031 $0.00401372 $1.001 $0.200367 $0.02101828 $2.35 $12.20 $0.04612328 $1.46 $0.336681 $0.999778 $1.064 $0.995603 $1.72 $0.999908 $0.999987 რიცხვი, რომელსაც ყველა მსხვილი AI ლაბორატორია იყენებდა კოდირების უპირატესობის დასამტკიცებლად, ახლახან უაზროდ გამოცხადდა. OpenAI-მ ამ კვირაში გამოაქვეყნა პოსტი, სადაც აცხადებს, რომ SWE-bench Verified, AI კოდირების შესაძლებლობების გასაზომი მთავარი ბენჩმარკი, იმდენად სავსეა ხარვეზიანი ტესტებითა და სატრენინგო მონაცემების გაჟონვით, რომ ის აღარ გეუბნებათ რაიმე სასარგებლოს იმის შესახებ, შეუძლია თუ არა მოდელს რეალურად პროგრამული უზრუნველყოფის დაწერა. ბენჩმარკი ასე მუშაობს: მიეცით AI-ს რეალური GitHub-ის პრობლემა პოპულარული ღია კოდის Python პროექტიდან, სთხოვეთ მას შეასწოროს შეცდომა ტესტების ნახვის გარეშე და შეამოწმეთ, მისი პატჩი აიძულებს თუ არა წარუმატებელ ტესტებს გაიაროს სხვა რამის გაფუჭების გარეშე. OpenAI-მ შექმნა SWE-bench Verified 2024 წლის აგვისტოში, როგორც ორიგინალური 2023 წლის ბენჩმარკის უფრო სუფთა ვერსია, 93 პროგრამული ინჟინრის მოზიდვით, რათა გაეფილტრათ შეუძლებელი ან ცუდად შემუშავებული ამოცანები. გაწმენდა იმდენად კარგად იმუშავა, რომ ყველა მსხვილმა ლაბორატორიამ დაიწყო მასზე ქულების მოყვანა, როგორც პროგრესის მტკიცებულება. როდესაც Anthropic-მა Claude Opus 4 გამოუშვა 2025 წლის მაისში, Decrypt-მა განაცხადა, რომ მოდელმა SWE-bench Verified-ზე 72.5% დააგროვა, რითაც აჯობა GPT-4.1-ის 54.6%-ს და Gemini 2.5 Pro-ს 63.2%-ს. ეს იყო კოდირების ბენჩმარკი, რომელსაც მნიშვნელობა ჰქონდა. მას შემდეგ, ყველა AI ლაბორატორიამ ამერიკიდან ჩინეთამდე აჩვენა SWE-ის შესრულება, რათა მოეთხოვა ტახტი, როგორც საუკეთესო მოდელი კოდირების შესაძლებლობებისთვის. ახლა OpenAI ამბობს, რომ ეს რბოლა ნაწილობრივ მირაჟი იყო. მოხსენების თანახმად, გუნდმა შეამოწმა 138 ამოცანა, რომლებშიც GPT-5.2 მუდმივად მარცხდებოდა 64 დამოუკიდებელი გაშვებისას, და ექვსმა ინჟინერმა განიხილა თითოეული მათგანი. საბოლოოდ დაასკვნეს, რომ ამ ამოცანების 59.4% გაუმართავია. დაახლოებით 35.5%-ს აქვს ტესტები იმდენად ვიწროდ დაწერილი, რომ მათ სჭირდებათ კონკრეტული ფუნქციის სახელი, რომელიც არასოდეს არის ნახსენები პრობლემის აღწერაში. კიდევ 18.8% ამოწმებს ფუნქციებს, რომლებიც საერთოდ არ იყო ორიგინალური პრობლემის ნაწილი, შეგროვებული დაუკავშირებელი pull request-ებიდან. დაბინძურების პრობლემა დაახლოებით ასე მუშაობს: SWE-bench თავის პრობლემებს იღებს ღია კოდის საცავებიდან, რომლებსაც AI კომპანიების უმეტესობა სკანირებს სატრენინგო ნაკრებების შექმნისას. OpenAI-მ შეამოწმა, ნახეს თუ არა GPT-5.2-მა, Claude Opus 4.5-მა და Gemini 3 Flash Preview-მ ბენჩმარკის გადაწყვეტილებები ტრენინგის დროს. სამივემ ნახა. მხოლოდ ამოცანის ID-ისა და მოკლე მინიშნების მიცემის შემდეგ, თითოეულ მოდელს შეეძლო ზუსტი კოდის შესწორების რეპროდუცირება მეხსიერებიდან, ცვლადების სახელებისა და inline კომენტარების ჩათვლით, რომლებიც არსად ჩანს პრობლემის აღწერაში. ერთ შემთხვევაში, GPT-5.2-ის აზროვნების ჯაჭვის ჟურნალებმა აჩვენა, რომ ის მსჯელობდა, რომ კონკრეტული პარამეტრი „დამატებული უნდა ყოფილიყო Django 4.1-ის გარშემო“ — დეტალი, რომელიც მხოლოდ Django-ს გამოშვების შენიშვნებში იყო ნაპოვნი და არა ამოცანის აღწერაში. ის პასუხობდა კითხვას, რომლის პასუხიც უკვე ნანახი ჰქონდა. OpenAI ახლა რეკომენდაციას უწევს SWE-bench Pro-ს, Scale AI-ის ახალ ბენჩმარკს, რომელიც იყენებს უფრო მრავალფეროვან კოდბაზებსა და ლიცენზიებს, რომლებიც ამცირებენ სატრენინგო მონაცემების ექსპოზიციას. შესრულების ვარდნა შემაშფოთებელია: მოდელები, რომლებმაც ძველ Verified ბენჩმარკზე 70%-ს გადააჭარბეს, SWE-bench Pro-ს საჯარო გაყოფაზე დაახლოებით 23%-ს აგროვებენ, ხოლო მის პირად ამოცანებზე კიდევ უფრო ნაკლებს. მიმდინარე საჯარო SWE-bench Verified ლიდერბორდზე, OpenAI შორს არის ბენჩმარკის პოდიუმიდან. ბენჩმარკის გაუქმება, სადაც აგებ და ისეთის მხარდაჭერა, სადაც ყველა 23%-დან იწყებს, ხელსაყრელ მომენტში ანულებს ქულებს და კონკურენტების პრეტენზიებს ნაკლებად შთამბეჭდავს ხდის. ეს განსაკუთრებით მნიშვნელოვანია იმის გათვალისწინებით, რომ DeepSeek-ის ნანატრი ახალი ვერსია, როგორც ამბობენ, აჯობებს ან უკიდურესად მიუახლოვდება ამერიკულ AI მოდელებს, განსაკუთრებით აგენტურულ და კოდირების ამოცანებში უფასო, ღია კოდის მოდელით. ეს მოდელი შესაძლოა დღეებში გამოვიდეს, და SWE-bench Verified შეიძლება იყოს მისი ხარისხის გასაზომი ძირითადი მეტრიკა. OpenAI-მ განაცხადა, რომ ის ქმნის კერძო ავტორობის შეფასებებს, რომლებიც არ გამოქვეყნდება ტესტირებამდე, მიუთითებს რა თავის GDPVal პროექტზე, სადაც დომენის ექსპერტები წერენ ორიგინალურ ამოცანებს, რომლებსაც აფასებენ გაწვრთნილი ადამიანური შემფასებლები. ბენჩმარკის პრობლემა ახალი არ არის და არ არის უნიკალური კოდირებისთვის. AI ლაბორატორიებმა გაიარეს მრავალი შეფასება, თითოეული სასარგებლო იყო მანამ, სანამ მოდელები მათზე არ გაწვრთნიდნენ ან სანამ ამოცანები ძალიან ვიწრო არ აღმოჩნდა. მაგრამ რაც ამ შემთხვევას აღსანიშნავს ხდის, არის ის, რომ OpenAI-მ გააპიარა SWE-bench Verified, ხელი შეუწყო მას მოდელების გამოშვებებში და ახლა საჯაროდ აფიქსირებს, თუ რამდენად საფუძვლიანად ჩავარდა ის — მათ შორის საკუთარი მოდელის მოტყუების ჩვენებით. თქვენი კარიბჭე Web3-ის სამყაროში. უახლესი ამბები, სტატიები და რესურსები, რომლებიც ყოველკვირეულად იგზავნება თქვენს შემოსულებში. © შემდეგი თაობის მედია კომპანია. 2026 Decrypt Media, Inc.