ხელოვნური ინტელექტი
26 February
OpenAI ამბობს, რომ AI კოდირების უნარის გასაზომად გამოყენებული ბენჩმარკი „დაბინძურებულია“ — აი, რატომ
OpenAI-მ განაცხადა, რომ AI კოდირების უნარების გასაზომი მთავარი ბენჩმარკი, SWE-bench Verified, „დაბინძურებულია“ ხარვეზიანი ტესტებითა და სატრენინგო მონაცემების გაჟონვით. კომპანიამ აღმოაჩინა, რომ მოდელები, მათ შორის საკუთარი GPT-5.2, ბენჩმარკის ამოცანებს მეხსიერებიდან პასუხობდნენ, რადგან ტრენინგის დროს უკვე ნანახი ჰქონდათ გადაწყვეტილებები. OpenAI ახლა რეკომენდაციას უწევს SWE-bench Pro-ს, ახალ ბენჩმარკს, რომელიც ამცირებს მონაცემთა ექსპოზიციას და აჩვენებს მოდელების შესრულების მკვეთრ ვარდნას. ეს ნაბიჯ