Utilização de informações lexicais extraídas automaticamente de corpora na análise sintática computacional do português
Bibliographic Data
| ID | 4383640 |
|---|---|
| Authors | Leonel Figueiredo De Alencar (0000-0001-8148-6994, Universidade Federal do Ceará, corresponding author) |
| Year | 2011 |
| Volume | 19 |
| Issue | 1 |
| Pages | 7-85 |
| Publication date | 2011-06-30 |
| Peer Reviewed | Yes |
| Open Access | Yes |
| Type | ARTICLE |
| Venue | Revista de Estudos da Linguagem (JOURNAL) |
| Journal identifiers | ISSN: 0104-0588 • E-ISSN: 2237-2083 |
| Publisher | Faculdade de Letras da UFMG (PUBLISHER) |
| DOI | 10.17851/2237-2083.19.1.7-85 |
| OpenAlex | W1567160687 |
| Language | PT |
| Citations received | 1 |
| References cited | 1 |
No desenvolvimento de analisadores sintáticos profundos paratextos irrestritos, a principal dificuldade a ser vencida é a modelaçãodo léxico. Tradicionalmente, duas estratégias têm sido usadas paralidar com a informação lexical na análise sintática automática: acompilação de milhares de entradas lexicais ou a formulação decentenas de regras morfológicas. Devido aos processos produtivosde formação de palavras, aos nomes próprios ou a grafias não padrão,a primeira estratégia, que subjaz aos analisadores do português doBrasil (PB) livremente descarregáveis da Internet, não é robusta.A última estratégia, por sua vez, constitui tarefa não trivial deengenharia do conhecimento, consumindo muito tempo. Nomomento, o PB não dispõe de um analisador sintático de amplacobertura licenciado como software livre. Visando aopreenchimento o mais rápido possível dessa lacuna, argumentamosneste artigo que uma solução bem menos custosa e muito maiseficiente para o gargalo lexical consiste em simplesmentereaproveitar, como componente lexical do processamento sintáticoprofundo, etiquetadores morfossintáticos livremente disponíveis. Além disso, graças à ampla e gratuita disponibilidade de corporamorfossintaticamente anotados do PB e eficientes pacotes deaprendizado de máquina, a construção de etiquetadores de altaacurácia adicionais tornou-se uma tarefa que quase não demandaesforço. A fim de integrar facilmente o output de etiquetadores dediferentes arquiteturas em parsers tabulares de gramáticas livresde contexto compilados por meio do Natural Language Toolkit(NLTK), desenvolvemos um módulo em Python denominadoALEXP. Pelo que sabemos, o ALEXP é o primeiro software livreespecialmente otimizado para o processamento do português arealizar essa tarefa. A funcionalidade da ferramenta é descrita pormeio de protótipos de gramática do PB aplicados na análise desentenças do mundo real, com resultados bastante promissores
Humanities · Linguistics and Language Studies · Natural Language Processing Techniques · Philosophy · Syntax, Semantics, Linguistic Variation
| Unique citing works | 1 |
|---|---|
| Citations per year | 0,25 |
| Citation span | 2022 - 2022 (1) |
| Citation velocity | historical |
| Highly cited | No |
| Citation types | Neutral: 1 |