İlon Maskın Grok 4.6 modeli tibbi süni intellekt agentlərinin imkanlarını qiymətləndirən MedAgentBench testində bütün rəqiblərini geridə qoyub. Avqustun 17-də açıqlanan nəticələrə görə, Grok 4.6 ilk cəhddə düzgün cavab vermə göstəricisində (pass@1) 95,9% nəticə göstərərək birinci pilləyə yüksəlib.
İkinci yerdə GPT-5.6 Sol qərarlaşıb — OpenAI modeli 94,7% nəticə əldə edib. Beləliklə, Grok 4.6 ilə GPT-5.6 Sol arasındakı fərq 1,2 faiz bəndi təşkil edib.
MedAgentBench adi tibbi bilik testlərindən fərqlənir. Burada modeldən yalnız xəstəliklər və müalicə üsulları barədə düzgün cavab vermək tələb olunmur.
Test böyük dil modellərinin real tibbi AI agenti kimi fəaliyyət göstərmək, elektron tibbi məlumatlarla işləmək və bir neçə mərhələdən ibarət tapşırıqları müstəqil şəkildə yerinə yetirmək qabiliyyətini yoxlayır.
MedAgentBench ümumilikdə 300 klinik ssenarini və 10 müxtəlif tapşırıq növünü əhatə edir. Bu səbəbdən yüksək nəticə modelin təkcə tibbi məlumat bazasına deyil, həm də praktiki iş proseslərini yerinə yetirmək qabiliyyətinə malik olduğunu göstərir.
Grok 4.6 təkrar sınaqlarda da sabit nəticələr nümayiş etdirib. Model əvvəlki Grok 4.5 versiyası ilə müqayisədə göstəricisini 2,5 faiz bəndi yaxşılaşdırıb.
Beləliklə, Grok 4.6 tibbi AI agentlərinin qiymətləndirildiyi bu testdə hazırda ən yüksək nəticəyə sahib modeldir. Lakin fərqin cəmi 1,2 faiz bəndi olması Grok və GPT-5.6 Sol arasında rəqabətin kifayət qədər sıx olduğunu göstərir.











