Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis
यह अनुभवजन्य अध्ययन प्रकट करता है कि जबकि जैविक लार्ज लैंग्वेज मॉडल्स (SCFMs) जैविक ज्ञान के लिए एक वास्तविक, निम्न-आयामी और आंशिक रूप से रैखिकीकृत ज्यामितीय संरचना को एनकोड करते हैं, यह संरचना मामूली है, अक्सर गैर-रैखिक रूप से उलझी हुई है, और काफी हद तक उस चीज़ के साथ ओवरलैप करती है जिसे शास्त्रीय अभिव्यक्ति-आधारित विधियाँ जैसे कि PCA पहले से ही पुनः प्राप्त कर सकती हैं, जो प्राकृतिक भाषा मॉडल्स में देखी गई स्पष्ट, नियमित ज्यामिति से कम है।