← Neueste Arbeiten
🤖 AI

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

Dieses Paper stellt Policy Iteration with Human Feedback (PIHF) vor, ein Framework, das einen Sprachmodell-Kritiker und die Aufsicht klinischer Experten nutzt, um natürliche Sprachrichtlinien für die Diagnose seltener Krankheiten iterativ zu verfeinern, wobei signifikante Leistungssteigerungen über verschiedene Modellgrößen hinweg ohne Änderung ihrer zugrunde liegenden Gewichte nachgewiesen werden.

Ursprüngliche Autoren: Minh-Ha Nguyen, Cathy Shyr

Veröffentlicht 2026-08-18
📖 1 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Minh-Ha Nguyen, Cathy Shyr

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →