Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages
यह अध्ययन प्रदर्शित करता है कि LLM-जनित सिंथेटिक बहुभाषी डेटा पर फाइन-ट्यून किया गया एक टू-स्टेज क्लिनिकल कोडिंग रिट्रीवल सिस्टम, गैर-अंग्रेजी भाषाओं में इंग्लिश-प्रीट्रेन्ड बेसलाइन्स से बेहतर प्रदर्शन करता है, जो व्यापक नेटिव बायोमेडिकल प्रीट्रेनिंग के बिना डोमेन-विशिष्ट मेडिकल रिट्रीवर्स बनाने के लिए एक स्केलेबल रेसिपी प्रदान करता है।