#მონაცემთა დაბინძურება

ამ თეგით ნაპოვნია 1 სტატია

ხელოვნური ინტელექტი 26 February

OpenAI ამბობს, რომ AI კოდირების უნარის გასაზომად გამოყენებული ბენჩმარკი „დაბინძურებულია“ — აი, რატომ

OpenAI-მ განაცხადა, რომ AI კოდირების უნარების გასაზომი მთავარი ბენჩმარკი, SWE-bench Verified, „დაბინძურებულია“ ხარვეზიანი ტესტებითა და სატრენინგო მონაცემების გაჟონვით. კომპანიამ აღმოაჩინა, რომ მოდელები, მათ შორის საკუთარი GPT-5.2, ბენჩმარკის ამოცანებს მეხსიერებიდან პასუხობდნენ, რადგან ტრენინგის დროს უკვე ნანახი ჰქონდათ გადაწყვეტილებები. OpenAI ახლა რეკომენდაციას უწევს SWE-bench Pro-ს, ახალ ბენჩმარკს, რომელიც ამცირებს მონაცემთა ექსპოზიციას და აჩვენებს მოდელების შესრულების მკვეთრ ვარდნას. ეს ნაბიჯ