Digitale lagre af gamle bøger

På Det Kongelige Bibliotek har de været i gang i lang tid med at digitalisere de mange gamle bøger i samlingen. ComON tog en tur ind i Den Sorte Diamant for at se på, hvordan de gør.

»Kvalitetsmæssigt er vi nogle af de førende. Kvantitativt er vi ikke,«fortæller it-konsulent Hamid Mehrabi.

Sektionsleder Britta Lorckmann supplerer:
»Vi har det problem, at dansk er et lille sprogområde. Så modsat engelsk, er efterspørgslen på verdensplan af danske materialer mindre.«

Det betyder at der er færre om at betale, og for Afdelingen for Digital Produktion og Udvikling er det i sidste ende et spørgsmål om økonomi, hvor meget der kan blive skannet.

24 kilometer hylder

Det Kongelige Bibliotek har omkring 24 kilometer hylder af danske samlinger, med stort set alt, hvad der er skrevet og trykt i Danmark siden 1700-tallet.

»Vi ville gerne starte fra A til Z, men det har vi ikke midlerne til,« fortæller Britta Lorckmann.

Derfor er det de forskellige afdelinger på biblioteket, der afgør hvad de vil have scannet først. Og så står Afdelingen for Digital Produktion og Udvikling for at scanne materialerne i samarbejdet med afdelingerne.

Men det er ikke altid materialernes beskaffenhed, der afgør hvor i køen de kommer til. Et legat kan gøre, at et nyt projekt bliver startet, selv om materialerne måske ikke er i den store fare for forvanskelse. Det handler jo om økonomi.

En stor skrivebordsscanner

Selve scanningen af materialerne foregår kun på biblioteket. Materialerne må ikke forlade biblioteket, så at have en tredje part til at udføre det manuelle arbejde er udelukket.

Maskinen ligner en større udgave af en skrivebordsscanner. Men der stopper sammenligningerne også. Det Kongelige Biblioteks scanner er en dyr sag, som kan give den høje opløsning, som langtidsbevaringen kræver.

Bøgerne bliver scannet til højopløsnings tiff-filer, og derefter udsat for OCR, Optical Character Recognition. Det er et system, der kan genkende bogstaver og omskrive indscanningerne til et tekst-dokument. Derved bliver det muligt at søge i teksterne.

Som eksempel fremhæver Britta Lorckmann Arkiv for Dansk Litteratur. Her er den danske litteratur, der er fri for copyright, såkaldt ”public domain,” lagt ud og gjort tilgængelig online.

Man kan søge i de OCR-genererede tekster, men endnu vigtigere, er det muligt at se scannet af den originale bog. På den måde kan brugerne sende en fejlmeddelelse.

Alle skal kunne læse med

Tilgængelighed for offentligheden er et af de største kriterier for arbejdet i Digital Udvikling og Produktion. Tidligere var der et modsætningsforhold i arbejdet i afdelingen.

Før bredbåndsforbindelser og hurtige computere var man nødt til at afveje forholdet mellem de store filer, der skal bruges til langstidsbevaring, samtidig med at lave billeder, der kunne fremvises over nettet.

Men udviklingen har heldigvis indhentet det, og i dag er det intet problem at lagre store filer, og samtidig have dem tilgængelige for offentligheden.

Hurtigere og billigere

»Alt er blevet hurtigere og billigere, og det har udryddet det modsætningsforhold,« forklarer Hamid Mehrabi.
I dag er deres scanner så effektiv, at kapaciteten er oppe på 40,000 sider om dagen, i forhold til de 400 billeder, de kunne scannne for ti år siden. Og så er opløsningen endda dobbelt så høj.

Tekstgenkendelse er ikke perfekt

Hver gang Digital Udvikling og Produktion starter et nyt projekt, bliver der oprettet en ordbog. Det fungerer sådan, at OCR-programmet så kan checke de ord, den har læst, op mod ordbogen.

»Et af problemerne med OCR er, at i gamle dage havde man ikke retstavning. Så man kan ikke bare matche ordene op med en ordbog. Så ville det gå helt galt,« forklarer Britta Lorckmann.

Men at lave en begrænset ordbog for enkelte tekster kan hjælpe OCR-programmet med at lave mere korrekte tekster. I afdelingen sigter de efter at have korrekthed på 99,8 procent.

»Hvis du skal have 100 procent korrekthed, bliver du nødt til at læse manuel korrektur på det hele. Og det er der ikke økonomi til. « fortæller Britta Lorckmann videre.

I stedet foretager afdelingen stikprøver. Hvis der er for mange fejl, bliver OCR-teksten brugt til at lave en PDF-fil. I denne fil bliver teksten lagt ind med scannet ovenpå. På den måde er teksten stadig søgbar, men brugeren ser kun scannet af de originale sider, ikke at OCR-processen har læst nogle bogstaver forkert. Sammen med brugerrettelserne er det så muligt at få korrektur på de tekster hen ad vejen.

»Vi går efter at få automatiserede processer med høj kvalitet, for manuelt arbejde er det dyre arbejde,« afslutter Britta Lorckmann.

Kommenter denne artikel


Kommentarer

Der er endnu ikke nogle der har kommenteret denne artikel, så du kan være den første!

Opgrader Internet Explorer eller bliv hacket
internet explorer 500x300 I dag, 15:52 Så er en ny grund til at få opgraderet sin gamle browser. IE6 og IE7 indeholder et kritisk sikkerhedshul.

(6 kommentarer)


Tilbage til Monkey Island
Guybrush I dag, 15:33 Den legendariske antihelt Guybrush Threepwood vender tilbage i friske farver.


Google snakker med Kina
Kina flag I dag, 14:59 Google forventer at nå til enighed med Kina inden for kort tid.

(2 kommentarer)


Her er Sonys svar på Natal
move I dag, 13:26 Sony har nu præsenteret sin nye bevægelsesfølsomme controller til PlayStation3.

(9 kommentarer)



Evonax:
Ny konkurrent til Edbpriser mødes med kritik
Jacob Risgaard Coolshop I dag, 13:02 Interesse-konflikt svækker tilliden til Evonax, siger spilforhandleren Coolshop.

(6 kommentarer)


Mobiltelefonen registrerer hver eneste bevægelse
big brother I dag, 12:35 Nu kan chefen overvåge alt hvad du foretager dig over mobilen.


Internet nomineret til Nobels fredspris
nobelpris CRN 500x500 portræt I dag, 11:24 Internettet er blandt de 237 nominerende til Nobels fredspris i år.

(3 kommentarer)


DSBs nye tog blokerer mobil-signaler
tog ic4 500x300 I dag, 11:02 Svært at føre mobilsamtaler i IC-4-tog

(6 kommentarer)



Spilstreaming betyder måske "game over" for konsoller
modern warfare 500x300 I dag, 10:44 Til juni er Onlive klar til at tilbyde streaming af spil over nettet.

(8 kommentarer)


Sun blev truet af Apple og Microsoft
suncon I dag, 09:52 Den tidligere Sun-chef tager nu hævn fra sin blog.

(2 kommentarer)



Seneste kommentarer
Afrika løser miljø-gåden

I de næste par år skal der findes en løsning på klodens mange miljøudfordringer. Den ofte oversete verdensdel syd for Europa kan bringe løsningen på mange af udfordringerne. ComON har kigget mod syd.


iMaxi ComOFF: Pak din iPad sikkert ind
01/03, 13:51 Hygiejnisk computer-indpakning.
Skygger 500X300 ComOFF: Lav suspekte links
26/02, 13:35 Sådan laver du korte - men mystiske links.

Mediaprovider