Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents
यह शोध पत्र HumanStudy-Bench प्रस्तुत करता है, जो एक ऐसा मूल्यांकन ढांचा है जो मानव आबादी से प्रमाणित सामाजिक विज्ञान निष्कर्षों और अनुमानात्मक पैटर्न को दोहराने की क्षमता को मापकर LLM-आधारित एजेंटों के मानवीय गुणों का आकलन करता है, जिससे यह पता चलता है कि एजेंट डिज़ाइन, मॉडल के पैमाने की तुलना में संरेखण (alignment) को अधिक महत्वपूर्ण रूप से प्रभावित करता है।