📰
AI & Tech14.06.2026·2 dəqiqəlik oxu

PixelRAG mətn analizatorlarını dəqiqlikdə üstələyir və AI agent token xərclərini 10 dəfə azaldır

UC Berkeley, Princeton Universiteti, EPFL və Databricks-dən bir tədqiqat qrupu PixelRAG adlı yeni bir sistem təqdim edib. Bu sistem veb səhifələri və sənədləri mətnə çevirmək əvəzinə, onları ekran görüntüsü kimi qeyd edir, həmin şəkilləri indeksləşdirir və əldə edilmiş hissələri birbaşa vizyon-dil modeli oxuyucusuna ötürür. Tədqiqatçıların fikrincə, ənənəvi mətn analizatorları məlumat itkisinə səbəb olur və səhv cavabların əksəriyyətindən məsuldur.

UC Berkeley, Princeton Universiteti, EPFL və Databricks-dən bir tədqiqat qrupu PixelRAG adlı yeni bir sistem təqdim edib. Bu sistem veb səhifələri və sənədləri mətnə çevirmək əvəzinə, onları ekran görüntüsü kimi qeyd edir, həmin şəkilləri indeksləşdirir və əldə edilmiş hissələri birbaşa vizyon-dil modeli oxuyucusuna ötürür. Tədqiqatçıların fikrincə, ənənəvi mətn analizatorları məlumat itkisinə səbəb olur və səhv cavabların əksəriyyətindən məsuldur. PixelRAG, 30 milyon ekran görüntüsü hissəsi üzərində sınaqdan keçirilərək bütün Vikipediyanı əhatə edib və altı müxtəlif meyarda mətn əsaslı RAG sistemlərindən daha yaxşı nəticə göstərib. Tədqiqatçılar, dəqiqliyi mətn əsaslı sistemlərə nisbətən 18.1%-ə qədər artırdığını bildirirlər. Mətn analizatorlarının təkmilləşdirilməsinin sonsuz bir proses olduğunu vurğulayan baş müəllif Yichuan Wang, hər veb saytın xüsusi qayğı tələb etdiyini qeyd edir. Bu səbəbdən, PixelRAG vizyon-dil modellərindəki son irəliləyişlərdən istifadə edərək sayta xas mühəndislik tələb etmədən işləyən bir əldəetmə sistemi qurmağı hədəfləyir. HTML analizatorları, korporativ RAG sistemlərinin etibar etdiyi əldəetmə siqnallarını məhv edir. Tədqiqat qrupunun məqsədi təmiz bir ucdan-uca arxitektura yaratmaq idi. Wang, müasir veb RAG boru xətlərinin göstərmə, analiz, təmizləmə, parçalama və bir çox əl işi mərhələlərini ehtiva etdiyini, hər mərhələnin potensial kaskad xətalara və orijinal veb səhifədən uzaqlaşdıran abstraksiyalara səbəb olduğunu izah edir. Analiz prosesi qaçılmaz olaraq məlumat itkisinə gətirib çıxarır: şəkillər, vizual iyerarxiya, tipoqrafiya, qalın mətn kimi vurğular, cədvəllər və düzənlər ya atılır, ya da qeyri-dəqiq formata çevrilir. Bu yanaşma, agentlərin token xərclərini 10 dəfə azaltmaqla yanaşı, daha dəqiq nəticələr əldə etməyə imkan verir.
Orijinal mənbə:PixelRAG beats text parsers on accuracy and cuts AI agent token costs 10x

Eyni mövzuda məqalələr

© 2025 Allahverdi Mehdiyev · Built with React & Vite