[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT
[pt] Rotular as classes gramaticais ao longo de uma sentença - part-ofspeech tagging - é uma das primeiras tarefas de processamento de linguagem natural, fornecendo atributos importantes para realizar tarefas de alta complexidade. A representação de texto a nível de palavra tem sido amplamente adota...
Main Author: | |
---|---|
Other Authors: | |
Language: | pt |
Published: |
MAXWELL
2016
|
Subjects: | |
Online Access: | https://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@1 https://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@2 http://doi.org/10.17771/PUCRio.acad.28461 |
id |
ndltd-puc-rio.br-oai-MAXWELL.puc-rio.br-28461 |
---|---|
record_format |
oai_dc |
spelling |
ndltd-puc-rio.br-oai-MAXWELL.puc-rio.br-284612018-07-09T18:52:53Z[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT [pt] ANOTAÇÃO MORFOSSINTÁTICA A PARTIR DO CONTEXTO MORFOLÓGICO EDUARDO DE JESUS COELHO REIS[pt] REDES NEURAIS[en] NEURAL NETWORKS[pt] PROCESSAMENTO DE LINGUAGEM NATURAL[en] NATURAL LANGUAGE PROCESSING[pt] PART OF SPEECH TAGGING[pt] REPRESENTACAO MORFOLOGICA[pt] N GRAMS[pt] REGULARIZACAO ESPARSA[pt] Rotular as classes gramaticais ao longo de uma sentença - part-ofspeech tagging - é uma das primeiras tarefas de processamento de linguagem natural, fornecendo atributos importantes para realizar tarefas de alta complexidade. A representação de texto a nível de palavra tem sido amplamente adotada, tanto através de uma codificação esparsa convencional, e.g. bagofwords; quanto por uma representação distribuída, como os sofisticados modelos de word-embedding usados para descrever informações sintáticas e semânticas. Um problema importante desse tipo de codificação é a carência de aspectos morfológicos. Além disso, os sistemas atuais apresentam uma precisão por token em torno de 97 por cento. Contudo, quando avaliados por sentença, apresentam um resultado mais modesto com uma taxa de acerto em torno de 55−57 por cento. Neste trabalho, nós demonstramos como utilizar n-grams para derivar automaticamente atributos esparsos e morfológicos para processamento de texto. Essa representação permite que redes neurais realizem a tarefa de POS-Tagging a partir de uma representação a nível de caractere. Além disso, introduzimos uma estratégia de regularização capaz de selecionar atributos específicos para cada neurônio. A utilização de regularização embutida em nossos modelos produz duas variantes. A primeira compartilha os n-grams selecionados globalmente entre todos os neurônios de uma camada; enquanto que a segunda opera uma seleção individual para cada neurônio, de forma que cada neurônio é sensível apenas aos n-grams que mais o estimulam. Utilizando a abordagem apresentada, nós geramos uma alta quantidade de características que representam afeições morfossintáticas relevantes baseadas a nível de caractere. Nosso POS tagger atinge a acurácia de 96, 67 por cento no corpus Mac-Morpho para o Português.[en] Part-of-speech tagging is one of the primary stages in natural language processing, providing useful features for performing higher complexity tasks. Word level representations have been largely adopted, either through a conventional sparse codification, such as bag-of-words, or through a distributed representation, like the sophisticated word embedded models used to describe syntactic and semantic information. A central issue on these codifications is the lack of morphological aspects. In addition, recent taggers present per-token accuracies around 97 percent. However, when using a persentence metric, the good taggers show modest accuracies, scoring around 55-57 percent. In this work, we demonstrate how to use n-grams to automatically derive morphological sparse features for text processing. This representation allows neural networks to perform POS tagging from a character-level input. Additionally, we introduce a regularization strategy capable of selecting specific features for each layer unit. As a result, regarding n-grams selection, using the embedded regularization in our models produces two variants. The first one shares globally selected features among all layer units, whereas the second operates individual selections for each layer unit, so that each unit is sensible only to the n-grams that better stimulate it. Using the proposed approach, we generate a high number of features which represent relevant morphosyntactic affection based on a character-level input. Our POS tagger achieves the accuracy of 96.67 percent in the Mac-Morpho corpus for Portuguese.MAXWELLRUY LUIZ MILIDIU2016-12-20TEXTOhttps://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@1https://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@2http://doi.org/10.17771/PUCRio.acad.28461pt |
collection |
NDLTD |
language |
pt |
sources |
NDLTD |
topic |
[pt] REDES NEURAIS [en] NEURAL NETWORKS [pt] PROCESSAMENTO DE LINGUAGEM NATURAL [en] NATURAL LANGUAGE PROCESSING [pt] PART OF SPEECH TAGGING [pt] REPRESENTACAO MORFOLOGICA [pt] N GRAMS [pt] REGULARIZACAO ESPARSA |
spellingShingle |
[pt] REDES NEURAIS [en] NEURAL NETWORKS [pt] PROCESSAMENTO DE LINGUAGEM NATURAL [en] NATURAL LANGUAGE PROCESSING [pt] PART OF SPEECH TAGGING [pt] REPRESENTACAO MORFOLOGICA [pt] N GRAMS [pt] REGULARIZACAO ESPARSA EDUARDO DE JESUS COELHO REIS [en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
description |
[pt] Rotular as classes gramaticais ao longo de uma sentença - part-ofspeech
tagging - é uma das primeiras tarefas de processamento de linguagem
natural, fornecendo atributos importantes para realizar tarefas de alta complexidade.
A representação de texto a nível de palavra tem sido amplamente
adotada, tanto através de uma codificação esparsa convencional, e.g. bagofwords; quanto por uma representação distribuída, como os sofisticados
modelos de word-embedding usados para descrever informações sintáticas e
semânticas. Um problema importante desse tipo de codificação é a carência
de aspectos morfológicos. Além disso, os sistemas atuais apresentam uma
precisão por token em torno de 97 por cento. Contudo, quando avaliados por sentença,
apresentam um resultado mais modesto com uma taxa de acerto em
torno de 55−57 por cento. Neste trabalho, nós demonstramos como utilizar n-grams
para derivar automaticamente atributos esparsos e morfológicos para processamento
de texto. Essa representação permite que redes neurais realizem
a tarefa de POS-Tagging a partir de uma representação a nível de caractere.
Além disso, introduzimos uma estratégia de regularização capaz de
selecionar atributos específicos para cada neurônio. A utilização de regularização
embutida em nossos modelos produz duas variantes. A primeira
compartilha os n-grams selecionados globalmente entre todos os neurônios
de uma camada; enquanto que a segunda opera uma seleção individual para
cada neurônio, de forma que cada neurônio é sensível apenas aos n-grams
que mais o estimulam. Utilizando a abordagem apresentada, nós geramos
uma alta quantidade de características que representam afeições morfossintáticas
relevantes baseadas a nível de caractere. Nosso POS tagger atinge a
acurácia de 96, 67 por cento no corpus Mac-Morpho para o Português. === [en] Part-of-speech tagging is one of the primary stages in natural language
processing, providing useful features for performing higher complexity
tasks. Word level representations have been largely adopted, either through
a conventional sparse codification, such as bag-of-words, or through a distributed
representation, like the sophisticated word embedded models used
to describe syntactic and semantic information. A central issue on these
codifications is the lack of morphological aspects. In addition, recent taggers
present per-token accuracies around 97 percent. However, when using a persentence
metric, the good taggers show modest accuracies, scoring around
55-57 percent. In this work, we demonstrate how to use n-grams to automatically
derive morphological sparse features for text processing. This representation
allows neural networks to perform POS tagging from a character-level input.
Additionally, we introduce a regularization strategy capable of selecting
specific features for each layer unit. As a result, regarding n-grams selection,
using the embedded regularization in our models produces two variants. The
first one shares globally selected features among all layer units, whereas the
second operates individual selections for each layer unit, so that each unit
is sensible only to the n-grams that better stimulate it. Using the proposed
approach, we generate a high number of features which represent relevant
morphosyntactic affection based on a character-level input. Our POS tagger
achieves the accuracy of 96.67 percent in the Mac-Morpho corpus for Portuguese. |
author2 |
RUY LUIZ MILIDIU |
author_facet |
RUY LUIZ MILIDIU EDUARDO DE JESUS COELHO REIS |
author |
EDUARDO DE JESUS COELHO REIS |
author_sort |
EDUARDO DE JESUS COELHO REIS |
title |
[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
title_short |
[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
title_full |
[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
title_fullStr |
[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
title_full_unstemmed |
[en] MORPHOSYNTACTIC ANNOTATION BASED ON MORPHOLOGICAL CONTEXT |
title_sort |
[en] morphosyntactic annotation based on morphological context |
publisher |
MAXWELL |
publishDate |
2016 |
url |
https://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@1 https://www.maxwell.vrac.puc-rio.br/Busca_etds.php?strSecao=resultado&nrSeq=28461@2 http://doi.org/10.17771/PUCRio.acad.28461 |
work_keys_str_mv |
AT eduardodejesuscoelhoreis enmorphosyntacticannotationbasedonmorphologicalcontext AT eduardodejesuscoelhoreis ptanotacaomorfossintaticaapartirdocontextomorfologico |
_version_ |
1718710430973558784 |