A Fine-Tuned BERT Classifier for Personal-Letter Titles in Late-Ming and Early-Qing Collected Works
Dit artikel introduceert Lepton, een fijngefineerde BERT-classificator die is getraind op 5.438 handgelabelde titels van drieëndertig literaten uit de late Ming- en vroege Qing-periode, die met succes persoonlijke brieven onderscheidt van verwarrende voorwoorden en is ingezet om ongeveer 55.000 brieven te identificeren voor het Ming Letter Platform via de China Biographical Database.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je door een enorme, oude bibliotheek loopt, gevuld met duizenden boeken. Dit zijn niet zomaar boeken; het zijn de verzamelde werken van beroemde Chinese geleerden uit de late 1500s tot de vroege 1700s. Elk boek heeft een inhoudsopgave, een lange lijst met titels. Sommige titels zijn voor gedichten, sommige voor officiële rapporten, en sommige zijn voor persoonlijke brieven.
Het probleem is dat de bibliotheek te groot is voor één persoon om elke enkele titel te lezen om de brieven te vinden. Je hebt een bibliothecaris nodig die de lijst kan scannen en direct kan zeggen: "Dat is een brief," of "Dat is iets anders."
Het "Op-elkaar-lijken"-Probleem
Het moeilijkste deel van deze baan is niet het vinden van de voor de hand liggende brieven. Het is het onderscheid maken tussen een persoonlijke brief en een afscheidsvoorwoord (een toespraak die iemand houdt wanneer hij de stad verlaat).
Denk eraan als het proberen te onderscheiden tussen een "Hallo"-tekstbericht en een "Vaarwel"-toespraak.
- De Oude Manier (De Regex): Historici gebruikten vroeger een eenvoudige regel: "Als de titel eindigt met het karakter voor 'Boek' (書), is het een brief."
- De Tekortkoming: Dit is als zeggen: "Als een tekstbericht eindigt met een punt, is het een liefdesbrief." Het mist 91% van de echte brieven, omdat de meeste oude brieftitels niet eindigen met dat specifieke karakter. Ze beginnen vaak met een werkwoord zoals "Antwoorden" of "Sturen".
- De Tweede Oude Manier: "Als de titel begint met een werkwoord zoals 'Antwoorden', is het een brief."
- De Tekortkoming: Dit vangt te veel valse alarmen. Afscheidstoespraken beginnen ook met werkwoorden zoals "Antwoorden" of "Sturen". Het is als een beveiligingsagent die iedereen stopt die "Hallo" zegt, zelfs als ze gewoon afscheid nemen van een vriend.
De Oplossing: "Lepton" (De Slimme Bibliothecaris)
De auteur, Queenie Luo, bouwde een digitale bibliothecaris genaamd Lepton.
Lepton is een computerprogramma gebaseerd op een technologie genaamd BERT (denk eraan als een super-slimme student die miljoenen moderne Chinese zinnen heeft gelezen en heeft geleerd hoe woorden samenpassen). In plaats van alleen te zoeken naar één specifiek karakter aan het begin of einde van een titel, kijkt Lepton naar het geheel.
- Hoe het leerde: De auteur gaf Lepton een trainingshandleiding met ongeveer 5.400 titels die handmatig door mensen waren gelabeld. Sommige waren brieven, sommige waren afscheidstoespraken. Lepton bestudeerde de patronen: "Ah, wanneer ik 'Antwoorden' zie gevolgd door een persoonsnaam, is dat meestal een brief. Wanneer ik 'Sturen' zie gevolgd door 'Voorwoord', is dat een toespraak."
- Het Resultaat: Lepton werd ongelooflijk goed in deze specifieke baan. Bij testen was het bijna perfect. Het maakte geen enkele fout door een toespraak een brief te noemen (100% precisie), en het miste slechts een klein handjevol echte brieven.
Wat Lepton Wel en Niet Kan
Het is belangrijk om te weten waarvoor dit instrument is ontworpen, net zoals je weet dat een hamer voor spijkers is, niet voor schroeven.
- Wat het doet: Het bekijkt een titel in een inhoudsopgave en beslist: "Is dit een persoonlijke brief of een afscheidstoespraak?"
- Wat het NIET doet:
- Het leest niet de daadwerkelijke inhoud van de brief (het kijkt alleen naar de titel).
- Het vertelt je niet aan wie de brief was gestuurd of wanneer hij werd geschreven.
- Het werkt niet goed op teksten uit veel eerder of later dan de Ming- en Qing-dynastieën (het is specifiek getraind op die periode).
- Het maakt geen onderscheid tussen officiële overheidsbrieven en privé-familienotities; het weet alleen dat het "brieven" zijn.
De Wereldwijde Impact
De auteur heeft Lepton aan het werk gezet in de China Biographical Database (CBDB). Door gebruik te maken van dit instrument, hebben onderzoekers duizenden boeken kunnen scannen en automatisch ongeveer 55.000 persoonlijke brieven kunnen vinden.
Dit heeft geholpen bij het bouwen van het Ming Letter Platform, een digitaal hulpmiddel dat historici in staat stelt de sociale netwerken van geleerden uit 500 jaar geleden in kaart te brengen. In plaats van jarenlang titels één voor één te lezen, hebben ze nu een kaart van wie aan wie schreef, allemaal dankzij een digitale bibliothecaris die leerde het verschil te zien tussen een "Hallo" en een "Vaarwel".
De Enige Zwakte
Lepton is geen magie. Het faalde op zes specifieke titels in de test. Dit waren zeer korte, vreemde titels die niet volgden de gebruikelijke regels (zoals alleen een persoonsnaam). Omdat Lepton leerde van "normale" voorbeelden, raakte het in de war door deze excentriekelingen en gokte het dat het toespraken waren. Het is een herinnering dat zelfs slimme computers moeite kunnen hebben met dingen die het patroon doorbreken.
Kortom: Het artikel beschrijft het bouwen van een gespecialiseerd AI-instrument dat fungeert als een hoogopgeleide bibliothecaris, in staat om direct duizenden oude boektitels te sorteren om persoonlijke brieven te vinden, en zo een probleem oplost dat eenvoudige trefwoordzoekopdrachten niet aankonden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.