Tədqiqatçılar GPT-5.4-ü geridə qoyan açıq mənbəli AI axtarış agenti Harness-1-i hazırladılar
İllinoys Universiteti (UIUC), Berkeley Kaliforniya Universiteti və açıq mənbəli AI vektor verilənlər bazası platforması Chroma-nın birgə tədqiqat əməkdaşlığı nəticəsində Harness-1 adlı 20 milyard parametrli açıq mənbəli axtarış agenti təqdim edildi. Bu agent OpenAI-nin gpt-oss-20B açıq mənbəli modeli əsasında qurulub və AI-nin mürəkkəb məlumat əldə etmə tapşırıqlarını necə yerinə yetirdiyini əsaslı şəkildə yenidən dizayn edir. Harness-1, seçilmiş verilənlər dəstindən düzgün məlumatları xatırlama qabiliyyətində orta hesabla 73% bal toplayaraq, GPT-5.4-ün 70.9% və ən dəqiq açıq mənbəli axtarış agenti olan Tongyi DeepResearch 30B-ni 11.4 faiz bəndi ilə geridə qoyaraq böyük bir performans sıçrayışı əldə etdi. Qeyd edək ki, GPT-5.5 bir aydan çoxdur mövcud olsa da, tədqiqatçılar öz modellərini qurarkən bu model mövcud olmadığı üçün onu sınaqdan keçirməyiblər.
İllinoys Universiteti (UIUC), Berkeley Kaliforniya Universiteti və açıq mənbəli AI vektor verilənlər bazası platforması Chroma-nın birgə tədqiqat əməkdaşlığı nəticəsində Harness-1 adlı 20 milyard parametrli açıq mənbəli axtarış agenti təqdim edildi. Bu agent OpenAI-nin gpt-oss-20B açıq mənbəli modeli əsasında qurulub və AI-nin mürəkkəb məlumat əldə etmə tapşırıqlarını necə yerinə yetirdiyini əsaslı şəkildə yenidən dizayn edir. Harness-1, seçilmiş verilənlər dəstindən düzgün məlumatları xatırlama qabiliyyətində orta hesabla 73% bal toplayaraq, GPT-5.4-ün 70.9% və ən dəqiq açıq mənbəli axtarış agenti olan Tongyi DeepResearch 30B-ni 11.4 faiz bəndi ilə geridə qoyaraq böyük bir performans sıçrayışı əldə etdi. Qeyd edək ki, GPT-5.5 bir aydan çoxdur mövcud olsa da, tədqiqatçılar öz modellərini qurarkən bu model mövcud olmadığı üçün onu sınaqdan keçirməyiblər.
Tərtibatçılar üçün ən vacib məqam odur ki, model və onun mühiti dərhal yüksək dərəcədə icazəli Apache 2.0 lisenziyası ilə və model kodu/çəkiləri Hugging Face platformasında əlçatandır. Harness-1 eyni zamanda Thinking Machines tərəfindən hazırlanmış Tinker adlı paylanmış, veb əsaslı AI model təlimi və incə tənzimləmə API-nin effektivliyinin sübutu kimi xidmət edir. Tinker xüsusi olaraq Harness-1-in təlimi və inferensiya işlətməsi üçün istifadə edilib və bu, interaktiv infrastrukturun növbəti nəsil avtonom modelləri necə aktiv şəkildə təmin etdiyini vurğulayır. Beləliklə, tədqiqatçılar bunu necə etdilər?
Tədqiqatçılar Harness-1 və onun rəqiblərini səkkiz yüksək dərəcədə mürəkkəb axtarış benchmarkı üzərində qiymətləndirdilər. Sadə trivia sualları vermək əvəzinə, bu testlər AI-nin müxtəlif və sıx məlumat mənbələrini araşdıran həqiqi bir tədqiqatçı kimi hərəkət etməsini tələb edirdi. Benchmarks bir neçə fərqli sahəni əhatə edirdi: açıq veb axtarışları, SEC-dən mürəkkəb maliyyə sənədləri, USPTO-dan texniki patent verilənlər bazaları və AI-nin məntiqi olaraq hissələri bir araya gətirməli olduğu "multi-hop" sual-cavab tapşırıqları. Bu yanaşma, Harness-1-in müəssisələr üçün böyük potensial daşıdığını göstərir, çünki o, həqiqi dünya məlumat əldə etmə problemlərini həll etməkdə üstün performans nümayiş etdirir.