Skip to main content

ETHNOS_APP

Home • Search • Journals • List 0

Utilização de informações lexicais extraídas automaticamente de corpora na análise sintática computacional do português

Bibliographic Data

ID4383640
AuthorsLeonel Figueiredo De Alencar (0000-0001-8148-6994, Universidade Federal do Ceará, corresponding author)
Year2011
Volume19
Issue1
Pages7-85
Publication date2011-06-30
Peer ReviewedYes
Open AccessYes
TypeARTICLE
VenueRevista de Estudos da Linguagem (JOURNAL)
Journal identifiersISSN: 0104-0588 • E-ISSN: 2237-2083
PublisherFaculdade de Letras da UFMG (PUBLISHER)
DOI10.17851/2237-2083.19.1.7-85
OpenAlexW1567160687
LanguagePT
Citations received1
References cited1

No desenvolvimento de analisadores sintáticos profundos paratextos irrestritos, a principal dificuldade a ser vencida é a modelaçãodo léxico. Tradicionalmente, duas estratégias têm sido usadas paralidar com a informação lexical na análise sintática automática: acompilação de milhares de entradas lexicais ou a formulação decentenas de regras morfológicas. Devido aos processos produtivosde formação de palavras, aos nomes próprios ou a grafias não padrão,a primeira estratégia, que subjaz aos analisadores do português doBrasil (PB) livremente descarregáveis da Internet, não é robusta.A última estratégia, por sua vez, constitui tarefa não trivial deengenharia do conhecimento, consumindo muito tempo. Nomomento, o PB não dispõe de um analisador sintático de amplacobertura licenciado como software livre. Visando aopreenchimento o mais rápido possível dessa lacuna, argumentamosneste artigo que uma solução bem menos custosa e muito maiseficiente para o gargalo lexical consiste em simplesmentereaproveitar, como componente lexical do processamento sintáticoprofundo, etiquetadores morfossintáticos livremente disponíveis. Além disso, graças à ampla e gratuita disponibilidade de corporamorfossintaticamente anotados do PB e eficientes pacotes deaprendizado de máquina, a construção de etiquetadores de altaacurácia adicionais tornou-se uma tarefa que quase não demandaesforço. A fim de integrar facilmente o output de etiquetadores dediferentes arquiteturas em parsers tabulares de gramáticas livresde contexto compilados por meio do Natural Language Toolkit(NLTK), desenvolvemos um módulo em Python denominadoALEXP. Pelo que sabemos, o ALEXP é o primeiro software livreespecialmente otimizado para o processamento do português arealizar essa tarefa. A funcionalidade da ferramenta é descrita pormeio de protótipos de gramática do PB aplicados na análise desentenças do mundo real, com resultados bastante promissores

Humanities · Linguistics and Language Studies · Natural Language Processing Techniques · Philosophy · Syntax, Semantics, Linguistic Variation

  • Aplicação estendida de analisador computacional na extração de sintagmas nominais em textos antigos

    Open Access•César Nardelli Cambraia, Ramon Cunha Sampaio Leite•Texto Livre Linguagem e Tecnologia•2022

  • Syntactic theory

    Ivan A Sag•Syntactic theory•1999

Unique citing works1
Citations per year0,25
Citation span2022 - 2022 (1)
Citation velocityhistorical
Highly citedNo
Citation typesNeutral: 1

Tools

Open DOIOpen Access
Ethnos_APP • Open Source Project • MIT License • Frontend v2.0.0 • Privacy and Cookies • API Documentation: api.ethnos.app/docs • API Source Code: GitHub • DOI: 10.5281/zenodo.17049435 • Frontend Source Code: GitHub • DOI: 10.5281/zenodo.17050053 • cruz.rio.br • Expectantes Misericordiae