Anar al contingut

Extracció de l'informació

De L'Enciclopèdia, la wikipedia en valencià

La extracció de l'informació (de les seues sigles en anglés IE, Information Extraction) és un tipo de recuperació de l'informació l'objectiu de la qual és extraure automàticament informació estructurada o semiestructurada des de documents llegibles per una computadora.

Una aplicació típica de IE és l'escanejat d'una série de documents escrits en una llengua natural i reblir una base de senyes en l'informació extreta. Estos texts poden estar en forma semiestructurada o desestructurada. Estos documents poden ser molt variopintos des d'artículs de prensa fins a informes científics que en general estan escrits en un llenguage humà. Les tendències actuals en relació en la IE utilisen tècniques de processament de llenguage natural que se centren en àrees molt restringides.

L'objectiu és processar estos documents en un software de processament de llenguage natural (NLP) per a extraure informació útil d'ells. Esta tasca és molt complexa ya que estos programes solen operar en uns dominis molt restringits. Lo que dificulta extraure l'informació de texts en un llenguage poc formal o imàgens.

Per eixemple, la Message Understanding Conference (MUC), o Conferència per a la Comprensió de Mensages és una competició que s'ha centrat en els següents aspectes durant els últims anys:

  • MUC-1 1987, MUC-2 1989: Mensages per a operacions navals.
  • MUC-3 1991: Terrorisme en països llatinoamericans.
  • MUC-5 1993: Microelectrónica.
  • MUC-6 1995: Nous artículs a prop dels canvis en la gerència.
  • MUC-7 1998: Informes de llançament de satèlits.

Tasques típiques de la IE

[editar | editar còdic]
  • Reconeiximent de noms d'entitats (NER, per les seues sigles en anglés). Buscar, localisar i classificar elements atòmics en text sobre categories predefinides com a noms de persones, organisacions, llocs, expressions d'hores, cantitats, valors monetaris, percentages, etc. Amprant el coneiximent del domini o informació atres sentències. Per a portar a terme esta localisació i identificació és necessari assignar un identificador únic a l'entitat extreta. Quan no es coneix res sobre les instàncies de les entitats, s'usa una tècnica anomenada detecció de noms d'entitats. Per eixemple si tenim este text: “Luis goja passejant en bicicleta”. La tasca de detecció trauria del text el nom Luis per a referir-ho a una persona. Que provablement siga el subjecte en el text.
  • Resolució de la correferencia (CR, per les seues sigles en anglés).: té com a objectiu detectar la correferencia dels vínculs entre les entitats del text. Esta tasca està restringida a trobar vínculs entre les entitats de noms que s'han extret prèviament. Per eixemple Societat Espanyola d'Automòvils de Turisme i SEAT fan referència a la mateixa entitat. l'anáfora és un tipo de correferencialidad.
  • Extracció de terminologia. Identifica i extrau candidats a térmens dels texts explorats. consistix en analisar un text per a detectar els arguments semàntics associats en els predicats o verps d'una sentència i aixina poder classificar-los conforme als rols específics. Per eixemple: Luis va comprar un ordenador a Juan. En este cas “Luis” representa a l'agent comprador i “Juan” a l'agent venedor, “un ordenador” representa l'objecte de la sentència i el verp de la frase és comprar.
  • Extracció de relacions. Requerix la detecció i classificació de les mencions a relacions semàntiques (com el número d'oficina d'un client o la direcció d'un client). Per a saber si per eixemple el client Jorge té com a número de teléfon 94220033 i el client Luis té el número 911230001.

Vore també

[editar | editar còdic]