Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

droid-life+1x+1x+1Google Alphabet Inc. -მა სამშაბათს წარმოადგინა Android Bench-ის მნიშვნელოვანი განახლება, რომელიც წარმოადგენს ლიდერთა დაფას იმის შესაფასებლად, თუ რამდენად კარგად უმკლავდებიან AI მოდელები Android-ის რეალურ საპროგრამო ამოცანებს. განახლება რეიტინგებს რვა ახალ მოდელს მატებს – რომელთა სათავეშია Anthropic-ის Claude Fable 5, რომელმაც 84,5%-იანი სიზუსტის მაჩვენებლით პირველი ადგილი დაიკავა – და ბენჩმარკის საბაზისო ჩარჩოს გადაჰყავს ახალ სისტემაზე, სახელად Harbor.developer.android+1
8 ივლისს გამოქვეყნებულ განახლებულ ლიდერთა დაფაზე Claude Fable 5 პირველ ადგილზეა, მას მოსდევს OpenAI-ის GPT 5.5 80,2%-ით და Claude Sonnet 5 76,2%-ით. Google-ის საკუთარმა Gemini 3.1 Pro Preview-მ 73,7%-ით მეხუთე ადგილი დაიკავა და GPT 5.4-საც ჩამორჩა. სხვა ახლად დამატებულ მოდელებს შორისაა Qwen 3.7 Max, Qwen 3.7 Plus, GLM 5.2, Kimi K2.7 Code და MiniMax M3.developer.android
შედეგები აგრძელებს მაისში შემჩნეულ ტენდენციას, როდესაც GPT 5.5 ლიდერობდა, ხოლო Gemini OpenAI-ის მოდელებს დაახლოებით ორი პროცენტული პუნქტით ჩამორჩებოდა. Fable 5-ის ჩართვით, ლიდერებს შორის სხვაობა კიდევ უფრო გაიზარდა. მოდელმა, რომელიც Anthropic-მა ივნისში გამოუშვა, წამყვანი ქულები დააფიქსირა კოდირების მრავალ ბენჩმარკზე, მათ შორის 80,3% SWE-Bench Pro-ზე.atlascloud+2
მოდელების დამატების გარდა, Google-მა Android Bench-ის ჩარჩო გადაიტანა Harbor-ზე, რაც, მისი თქმით, უფრო მკაცრი, რეალურ სამყაროზე დაფუძნებული AI მსჯელობის ტესტების საშუალებას იძლევა. ბენჩმარკი აფასებს მოდელებს 100 სატესტო შემთხვევის მიხედვით, რომლებიც თითოეული 10-ჯერ ტარდება, და ზომავს არა მხოლოდ სიზუსტეს, არამედ ლატენტურობასა და თითო გაშვების ღირებულებას – განზომილებები, რომლებიც Google-მა პირველად მაისში დანერგა.x+2
Google-მა ასევე მიუთითა, რომ დეველოპერებს ახლა შეუძლიათ პირდაპირ შეიტანონ წვლილი ბენჩმარკში, რაც არის ცვლილება, რომელსაც შეუძლია გააფართოოს Android-ის სპეციფიკური კოდირების გამოწვევების სპექტრი, რომელიც გამოიყენება მოდელების შესამოწმებლად. განახლებისას დაარქივდა რამდენიმე ძველი მოდელი, მათ შორის Claude Opus 4.6, Claude Sonnet 4.5 და GPT-ის ადრეული ვარიანტები.developer.android+1
ახალ ლიდერთა დაფაზე არსებული ხარჯებისა და სიჩქარის მონაცემები გვთავაზობს პრაქტიკულ ხედვას სუფთა სიზუსტის მიღმა. მაგალითად, Deepseek V4 Flash-ი აფიქსირებს მოკრძალებულ 54,7%-ს, მაგრამ ბენჩმარკის თითო გაშვება მხოლოდ 1,50 დოლარი ღირს, მაშინ როცა Claude Fable 5-ის საუკეთესო შედეგი თითო გაშვებაზე 133,20 დოლარი ჯდება. ეს კომპრომისები ხაზს უსვამს იმ არჩევანს, რომლის წინაშეც დგანან Android-ის დეველოპერები, რადგან AI-ზე დაფუძნებული კოდირების ინსტრუმენტები ყოველდღიურ სამუშაო პროცესებში მკვიდრდება – და რადგან Google-ის საკუთარი მოდელები აგრძელებენ Anthropic-ისა და OpenAI-ის კონკურენტების დევნას იმ ბენჩმარკზე, რომელიც თავად Google-მა შექმნა.developer.android