AI-For-Beginners/translations/no/lessons/5-NLP/19-NER/lab
localizeflow[bot] 7a9b37f3b1 chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:07:34 +00:00
..
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:07:34 +00:00

README.md

NER

Laboppgave fra AI for Beginners Curriculum.

Oppgave

I denne labben skal du trene en modell for navngitt enhetsgjenkjenning (NER) for medisinske termer.

Datasettet

For å trene en NER-modell trenger vi et korrekt merket datasett med medisinske enheter. BC5CDR-datasettet inneholder merket informasjon om sykdommer og kjemiske enheter fra mer enn 1500 artikler. Du kan laste ned datasettet etter å ha registrert deg på deres nettside.

BC5CDR-datasettet ser slik ut:

6794356|t|Tricuspid valve regurgitation and lithium carbonate toxicity in a newborn infant.
6794356|a|A newborn with massive tricuspid regurgitation, atrial flutter, congestive heart failure, and a high serum lithium level is described. This is the first patient to initially manifest tricuspid regurgitation and atrial flutter, and the 11th described patient with cardiac disease among infants exposed to lithium compounds in the first trimester of pregnancy. Sixty-three percent of these infants had tricuspid valve involvement. Lithium carbonate may be a factor in the increasing incidence of congenital heart disease when taken during early pregnancy. It also causes neurologic depression, cyanosis, and cardiac arrhythmia when consumed prior to delivery.
6794356	0	29	Tricuspid valve regurgitation	Disease	D014262
6794356	34	51	lithium carbonate	Chemical	D016651
6794356	52	60	toxicity	Disease	D064420
...

I dette datasettet finner du artikkeltitler og sammendrag i de to første linjene, og deretter individuelle enheter med start- og sluttposisjoner innenfor tittel+sammendrag-blokken. I tillegg til enhetstype får du også ontologi-IDen til denne enheten innenfor en medisinsk ontologi.

Du må skrive noe Python-kode for å konvertere dette til BIO-koding.

Nettverket

Første forsøk på NER kan gjøres ved å bruke et LSTM-nettverk, som i eksempelet du har sett under leksjonen. Men i NLP-oppgaver viser transformer-arkitektur, og spesielt BERT-språkmodeller, mye bedre resultater. Forhåndstrente BERT-modeller forstår den generelle strukturen i et språk og kan finjusteres for spesifikke oppgaver med relativt små datasett og lave beregningskostnader.

Siden vi planlegger å bruke NER i en medisinsk kontekst, gir det mening å bruke en BERT-modell trent på medisinske tekster. Microsoft Research har gitt ut en forhåndstrent modell kalt [PubMedBERT][PubMedBERT] ([publikasjon][PubMedBERT-Pub]), som ble finjustert ved bruk av tekster fra PubMed arkivet.

Den de facto standarden for trening av transformer-modeller er Hugging Face Transformers biblioteket. Det inneholder også et arkiv med forhåndstrente modeller vedlikeholdt av fellesskapet, inkludert PubMedBERT. For å laste inn og bruke denne modellen trenger vi bare noen få linjer med kode:

model_name = "microsoft/BiomedNLP-PubMedBERT-base-uncased-abstract"
classes = ... # number of classes: 2*entities+1
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = BertForTokenClassification.from_pretrained(model_name, classes)

Dette gir oss selve model, bygget for tokenklassifiseringsoppgaver med classes antall klasser, samt tokenizer-objektet som kan dele opp inputtekst i tokens. Du må konvertere datasettet til BIO-format, med hensyn til PubMedBERT-tokenisering. Du kan bruke denne Python-koden som inspirasjon.

Oppsummering

Denne oppgaven er svært lik den faktiske oppgaven du sannsynligvis vil ha hvis du ønsker å få mer innsikt i store mengder naturlige språktekster. I vårt tilfelle kan vi bruke den trente modellen på datasettet med COVID-relaterte artikler og se hvilke innsikter vi kan få. Denne bloggposten og denne artikkelen beskriver forskningen som kan gjøres på dette korpuset av artikler ved bruk av NER.


Ansvarsfraskrivelse:
Dette dokumentet er oversatt ved hjelp av AI-oversettelsestjenesten Co-op Translator. Selv om vi streber etter nøyaktighet, vær oppmerksom på at automatiserte oversettelser kan inneholde feil eller unøyaktigheter. Det originale dokumentet på sitt opprinnelige språk bør anses som den autoritative kilden. For kritisk informasjon anbefales profesjonell menneskelig oversettelse. Vi er ikke ansvarlige for eventuelle misforståelser eller feiltolkninger som oppstår ved bruk av denne oversettelsen.