VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
تقترح الورقة البحثية VCap، وهي آلية مكافأة جديدة تعتمد على نظام "الشاهد-المُحكّم" تستفيد من دقة بمستوى التوزيع الهيبرجيومتري للتحقق من الاتساق الواقعي بين التعليقات المرجعية والمولدة، مما يتيح تعميماً من الضعيف إلى القوي في التعلم المعزز يسمح لنموذج بحجم 8 مليار بارامتر بالتفوق على أنظمة التعليق البصري الرائدة.