Artigo

05 de agosto de 2026

Extração e integração estruturada de resultados de exames médicos em PDF utilizando Inteligência Artificial

Jorge Luiz Dutra Andrade; Gabriel Custódio Rangel

DOI: 10.22167/2675-6528-202600977

Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.

Resumo

A crescente digitalização dos serviços de saúde ampliou o uso de sistemas de informação clínica, mas a integração de resultados de exames laboratoriais em formato PDF permanece desafiadora devido à heterogeneidade e à ausência de padronização dos dados. Diante desse cenário, desenvolveu-se e avaliou-se uma solução para a extração e integração estruturada desses resultados utilizando Inteligência Artificial, visando reduzir erros, retrabalho e o tempo de processamento no registro em prontuários eletrônicos. A pesquisa caracterizou-se como aplicada e tecnológica, com abordagem qualitativa complementada por indicadores quantitativos, e foi conduzida por meio de um estudo de caso em ambiente controlado. Um protótipo foi implementado em Node.js com TypeScript, Express, PostgreSQL, Prisma e autenticação JWT, integrando-se a modelos de linguagem baseados em GPT para interpretação semântica e estruturação dos dados extraídos. Testes realizados com cinco conjuntos de documentos anonimizados em português demonstraram viabilidade técnica e estabilidade operacional, sem a observação de erros com impacto funcional. Comparado ao processo manual, o tempo médio de processamento foi reduzido de 233,28 segundos para 13,8 segundos, resultando em um ganho médio de eficiência de 93,9%. Concluiu-se que a solução automatizou o fluxo de processamento, mitigou a dependência de etapas manuais e disponibilizou dados estruturados para consulta e validação em sistemas de informação em saúde, evidenciando ganhos operacionais, maior padronização dos registros e preservação da integridade semântica das informações clínicas.

Palavras-chave: Automação; Dados clínicos; Prontuários eletrônicos; Saúde digital; Sistemas de informação em saúde.

1. Introdução

A paisagem da saúde contemporânea é marcada por uma transformação digital acelerada, impulsionando a adoção de sistemas de informação clínica em larga escala. Essa transição visa otimizar a gestão de pacientes, aprimorar a qualidade do atendimento e facilitar a tomada de decisão baseada em evidências (World Health Organization, 2019). A informatização dos serviços de saúde tem demonstrado ganhos significativos em eficiência operacional e na disponibilidade de informações para o apoio clínico (Bates et al., 2018). Contudo, a integração de dados provenientes de diversas fontes, especialmente resultados de exames laboratoriais, ainda representa um obstáculo considerável. Esses resultados, cruciais para o acompanhamento clínico e diagnóstico, são frequentemente gerados em documentos digitais, como o formato PDF, que, apesar de sua ubiquidade, apresentam estrutura heterogênea e, muitas vezes, não padronizada. A ausência de um formato uniforme dificulta a leitura automática, a padronização e a reutilização eficaz dos dados, criando um gargalo na interoperabilidade dos sistemas de informação em saúde.

A complexidade da integração de dados em ambientes de saúde digital é tema amplamente discutido na literatura. Kellermann e Jones (2013) enfatizam que a simples adoção de sistemas digitais não garante a integração efetiva das informações clínicas, especialmente quando estas se originam de fontes externas ou possuem variabilidade estrutural. A falta de padronização no tratamento desses dados compromete a interoperabilidade entre sistemas, impactando a qualidade dos registros clínicos e a capacidade de realizar análises robustas para suporte à decisão (Hripcsak e Albers, 2015). No contexto dos exames laboratoriais, a predominância do formato PDF agrava essa questão. Embora amplamente utilizados para disseminar resultados, sua natureza predominantemente não estruturada impõe desafios substanciais à extração automática de informações. A variabilidade na apresentação de dados, layouts e terminologias dentro desses arquivos exige intervenção manual intensiva, propensa a erros e ineficiências (Kaur e Singh, 2021; Hom et al., 2022). Essa dependência manual retarda a atualização dos prontuários eletrônicos e introduz riscos de inconsistência e perda de integridade semântica dos dados.

Diante desses desafios, a Inteligência Artificial (IA) emerge como tecnologia promissora para revolucionar o processamento de informações em saúde. A capacidade da IA de interpretar, analisar e estruturar grandes volumes de dados, mesmo em formatos não padronizados, oferece um caminho para superar as barreiras de integração (Almeida et al., 2024). Modelos de linguagem avançados podem ser treinados para identificar entidades clínicas, extrair valores numéricos e suas unidades de medida, e normalizar terminologias, transformando dados brutos e não estruturados em informações prontas para armazenamento em bancos de dados relacionais. Essa automação não só acelera o fluxo de trabalho, mas também mitiga erros de transcrição e retrabalho administrativo, comuns em processos manuais. A estruturação consistente dos dados permite que as informações sejam manipuladas computacionalmente, viabilizando consultas complexas, comparações temporais e a geração de visualizações que enriquecem a análise clínica e apoiam a tomada de decisão em tempo real. A aplicação de IA neste domínio representa, portanto, um avanço significativo na busca por sistemas de saúde mais eficientes, seguros e interoperáveis.

Apesar do potencial da saúde digital e da IA, a extração e integração de resultados de exames laboratoriais em formato PDF continuam a ser um ponto crítico, gerando ineficiências operacionais e comprometendo a qualidade dos dados clínicos. A gestão manual desses resultados é caracterizada por alta incidência de erros de transcrição, significativo retrabalho administrativo e um tempo de processamento elevado, impactando negativamente a agilidade e a precisão na atualização dos prontuários eletrônicos e a tomada de decisão clínica. A necessidade de uma solução que automatize e padronize esse fluxo é, portanto, premente para otimizar recursos humanos, aumentar a confiabilidade dos registros e garantir a integridade semântica das informações. Este trabalho, motivado por essa lacuna e pela busca por maior eficiência e consistência no tratamento de dados clínicos, propõe-se a desenvolver e avaliar uma solução para a extração e integração estruturada de resultados de exames médicos em PDF utilizando Inteligência Artificial, com o objetivo de reduzir erros, retrabalho e o tempo de processamento no registro dessas informações em prontuários eletrônicos.

2. Material e Métodos

A pesquisa caracterizou-se como um estudo aplicado, de natureza tecnológica, com o objetivo de desenvolver e avaliar uma solução prática para a extração e integração de dados. Adotou-se uma abordagem predominantemente qualitativa, complementada por indicadores quantitativos de desempenho para mensurar a eficácia da solução proposta. Essa combinação permitiu uma compreensão aprofundada dos aspectos técnicos e operacionais do sistema, ao mesmo tempo em que forneceu métricas objetivas para a avaliação de sua performance. A natureza tecnológica da pesquisa focou na criação de um protótipo funcional, visando à resolução de um problema real no processamento de informações em saúde, conforme a necessidade de automatização de processos.

A estratégia metodológica empregada foi a de estudo de caso, realizada em um ambiente controlado para garantir a observação consistente do comportamento do sistema e minimizar interferências externas. Este tipo de estudo é frequentemente utilizado em Engenharia de Software para investigar a viabilidade técnica e operacional de novas soluções (Yin, 2018; Wohlin et al., 2012). O foco do estudo foi o desenvolvimento de um sistema para automatizar a extração e integração de resultados de exames médicos em formato PDF, com ênfase na estruturação de dados clínicos. A unidade de análise consistiu em documentos PDF contendo resultados de exames laboratoriais.

A escolha do formato PDF como unidade de análise justificou-se pela sua ampla utilização na disponibilização de exames laboratoriais, apesar dos desafios inerentes à extração automática de informações devido à sua natureza não estruturada (Kaur e Singh, 2021). A pesquisa delimitou-se a exames laboratoriais rotineiros, processados em língua portuguesa e provenientes de arquivos previamente anonimizados. Para os testes, foram utilizados cinco conjuntos distintos de exames laboratoriais, selecionados para abranger variações no número de páginas e na quantidade de valores numéricos presentes nos documentos, permitindo uma avaliação abrangente da robustez do sistema frente a diferentes complexidades documentais.

A aplicação foi desenvolvida utilizando Node.js com TypeScript, empregando o framework Express para a criação de serviços do tipo Representational State Transfer (REST). Essa arquitetura foi selecionada por suas características de modularidade, escalabilidade e interoperabilidade entre sistemas distribuídos (Fielding, 2000). Para a persistência dos dados estruturados, utilizou-se o sistema gerenciador de banco de dados relacional PostgreSQL, valorizado por seu suporte a transações e integridade referencial. O acesso ao banco de dados foi gerenciado por meio do Object Relational Mapper (ORM) Prisma, que facilitou a definição do esquema e a execução de migrações, contribuindo para a consistência da camada de persistência.

A autenticação e o controle de acesso ao sistema foram implementados utilizando JSON Web Token (JWT), um mecanismo comum em aplicações baseadas em APIs REST que permite autenticação stateless e comunicação segura entre cliente e servidor (Fernández et al., 2020). Após a extração do conteúdo textual dos arquivos PDF, os dados foram submetidos a um processo de interpretação semântica. Este processo utilizou serviços de Inteligência Artificial baseados em modelos Generative Pre-trained Transformer (GPT), acessados via API, para identificar entidades clínicas e organizar as informações em uma estrutura padronizada, pronta para armazenamento em banco de dados relacional. O modelo de linguagem foi tratado como um componente externo, focando a avaliação na arquitetura e fluxo de processamento.

A arquitetura do sistema foi concebida de forma modular, organizada em camadas para otimizar a manutenção e o reúso do código-fonte. Essa estrutura permitiu uma avaliação detalhada do comportamento de cada etapa do processamento de forma isolada, facilitando a identificação de falhas pontuais e a análise do impacto de cada componente no fluxo automatizado. A camada de controladores foi responsável por receber as requisições, realizar validações de entrada e encaminhar o processamento aos serviços. A camada de serviços, por sua vez, concentrou o acesso ao banco de dados PostgreSQL, garantindo a aplicação de regras de domínio e a consistência dos dados.

A modelagem do banco de dados incluiu a definição de tabelas, campos, tipos de dados e o estabelecimento de relações, além da criação de chaves primárias e estrangeiras e regras de validação. As migrações para a construção e evolução do esquema do banco de dados foram devidamente criadas. As rotas do sistema foram definidas em um arquivo específico, organizando os caminhos públicos da aplicação, e a inicialização do servidor ocorreu em outro arquivo central. Essa organização arquitetural serviu como base para a avaliação empírica do protótipo, permitindo observar o impacto do fluxo automatizado na redução de intervenções manuais e na consistência dos dados estruturados.

Uma rota específica foi implementada para o envio de arquivos PDF, configurada como um endpoint que recebia a Uniform Resource Locator (URL) do documento e um identificador do paciente. Este endpoint era responsável por extrair o conteúdo textual do PDF e encaminhar os dados para o serviço de processamento via API do ChatGPT. O objetivo era interpretar e estruturar as informações extraídas, que, após o processamento, eram retornadas ao backend do sistema para validação e revisão pelo usuário. O fluxo de comunicação do sistema envolvia o usuário, controladores, serviços, banco de dados e a API do ChatGPT, demonstrando a interação entre os componentes.

Para a avaliação de desempenho do sistema, foram adotadas duas métricas principais: o tempo total de processamento e a ocorrência de erros na extração das informações. O processo manual de inserção de resultados em sistemas de gestão clínica serviu como referência para a comparação. Consideraram-se como erros quaisquer inconsistências que demandassem correção manual dos dados estruturados após o processamento automatizado. A análise comparativa entre os resultados obtidos nos diferentes conjuntos de documentos e o processo manual permitiu identificar ganhos operacionais, avaliar a consistência do sistema frente a diferentes volumes de dados e apontar as limitações da solução proposta.

A validação dos dados estruturados foi realizada pelo usuário, que conferia os resultados extraídos em relação ao documento original em PDF. Essa etapa foi considerada crucial para assegurar a confiabilidade das informações antes de sua persistência definitiva no banco de dados. É importante notar que o tempo despendido na validação não foi incluído na análise comparativa de desempenho, pois essa atividade é inerente tanto ao processo automatizado quanto ao manual. Adicionalmente, para mitigar inconsistências na padronização de nomes de exames e unidades de medida, implementou-se uma estratégia baseada no fornecimento de uma lista inicial de exames laboratoriais padronizados, utilizada como referência durante a interpretação semântica pelo modelo de linguagem.

Os aspectos éticos da pesquisa foram rigorosamente observados, com todos os arquivos PDF utilizados sendo previamente anonimizados. Esse processo de sanitização textual foi automatizado e implementado em linguagem JavaScript, aplicando expressões regulares para identificar e remover dados pessoais sensíveis. Informações como Cadastro de Pessoa Física (CPF), nome do paciente, data de nascimento e idade foram substituídas por marcadores genéricos, como “[NOME_REMOVIDO]” e “[CPF_REMOVIDO]”. Essa abordagem garantiu a preservação da estrutura textual necessária para o processamento, ao mesmo tempo em que assegurou que apenas dados desidentificados fossem enviados aos serviços de Inteligência Artificial, eliminando o tratamento de dados pessoais no âmbito da pesquisa.

O estudo, embora robusto em seu desenho, apresentou algumas limitações metodológicas inerentes ao seu escopo. A avaliação foi conduzida em um ambiente controlado, o que, embora essencial para a observação consistente do sistema, pode não refletir integralmente as variabilidades encontradas em contextos reais de uso. Além disso, a dependência de serviços externos de Inteligência Artificial para a interpretação semântica dos dados pode impactar a reprodutibilidade e o controle total sobre o processo de interpretação. A solução proposta foi delimitada a exames laboratoriais de sangue em formato PDF e em língua portuguesa, não abrangendo outros tipos de exames clínicos ou variações de formato e idioma.

3. Resultados e Discussão

Os resultados deste estudo demonstram a viabilidade técnica e operacional de um protótipo funcional desenvolvido para automatizar a extração, estruturação e persistência de dados de exames médicos em formato PDF. A avaliação, conduzida em um ambiente controlado, permitiu analisar o funcionamento do fluxo de processamento, a consistência dos dados gerados e os impactos operacionais em comparação com o processo manual tradicional. A abordagem adotada, que integra princípios de engenharia de software com capacidades de inteligência artificial, revelou-se eficaz na superação de desafios inerentes à heterogeneidade e à natureza não estruturada dos documentos de saúde.

Funcionamento do Protótipo e Fluxo de Processamento

O protótipo demonstrou capacidade de executar de forma contínua e estável o fluxo completo de processamento de exames laboratoriais. Esse fluxo inicia-se com o recebimento do arquivo PDF, prossegue com a extração do conteúdo textual, avança para a interpretação semântica mediada por serviços de Inteligência Artificial, culmina na estruturação dos dados e, finalmente, na persistência em um banco de dados relacional. Durante todos os testes realizados, o sistema operou sem interrupções críticas ou falhas que pudessem comprometer a conclusão do processamento, indicando uma robustez notável para uma solução em fase de prototipagem. A estabilidade operacional é um achado crucial, pois em ambientes clínicos, a interrupção de sistemas pode ter consequências graves, afetando a continuidade do atendimento e a segurança do paciente. A disponibilidade dos dados estruturados no banco de dados relacional ao final do processamento é um diferencial, permitindo consultas posteriores e validação das informações extraídas, o que é fundamental para a integridade dos prontuários eletrônicos.

A arquitetura modular adotada no desenvolvimento do sistema desempenhou um papel fundamental na facilitação da identificação de eventuais falhas pontuais durante os testes. A separação clara de responsabilidades entre as camadas de controle, serviços e persistência, conforme preconizado por Fielding (2000) em arquiteturas REST, permitiu uma análise isolada do comportamento de cada componente. Essa modularidade não apenas otimiza a manutenção e o reúso do código-fonte, mas também confere ao sistema uma maior resiliência, uma vez que problemas em uma camada específica podem ser isolados e corrigidos sem comprometer a funcionalidade global. A capacidade de isolar e diagnosticar falhas é particularmente valiosa em sistemas complexos que interagem com serviços externos, como modelos de linguagem de IA, onde a origem de um problema pode ser multifacetada.

O fluxo automatizado implementado pelo protótipo resultou em uma redução significativa da necessidade de intervenções manuais. Este é um dos principais ganhos operacionais, pois a dependência de processos manuais é uma fonte conhecida de erros de transcrição, retrabalho administrativo e lentidão na atualização de prontuários eletrônicos, conforme destacado por Hripcsak e Albers (2015). Ao minimizar a entrada manual de dados, o sistema não apenas acelera o processo, mas também eleva a confiabilidade dos registros clínicos. A automação de tarefas repetitivas e propensas a erros humanos é um objetivo central da saúde digital, e os resultados aqui apresentados corroboram o potencial da Inteligência Artificial para alcançar esse objetivo (Almeida et al., 2024). A diminuição de erros e o aumento da confiabilidade são diretamente traduzíveis em melhor qualidade da informação em saúde, o que, por sua vez, apoia decisões clínicas mais seguras e eficientes.

Figura 1. Fluxograma do processo de comunicação do sistema.

Fonte: Dados originais da pesquisa

Conforme ilustrado na Figura 1, o fluxo de comunicação do sistema envolve uma interação orquestrada entre o usuário, os controladores, os serviços, o banco de dados e a API do ChatGPT. Essa representação visual do processo destaca a centralidade da API na interpretação semântica dos dados, mas também a importância das camadas de software desenvolvidas internamente para gerenciar a requisição, a persistência e a resposta ao usuário. A requisição inicial do usuário é interceptada pelos controladores, que validam a entrada e a encaminham aos serviços. Os serviços, por sua vez, interagem com o banco de dados para operações de consulta e gravação, e com a API do ChatGPT para processar o texto anonimizado e obter o resultado estruturado. Esse ciclo de comunicação, que culmina no retorno da resposta ao usuário, é um exemplo prático de como a arquitetura de microsserviços e APIs pode ser empregada para construir sistemas distribuídos e interoperáveis, conforme descrito por Fielding (2000). A segurança dessa comunicação é garantida pela autenticação via JWT, conforme discutido por Fernández et al. (2020), assegurando que apenas usuários autorizados possam interagir com o sistema e que os dados trafeguem de forma segura.

Figura 2. Exemplo parcial de requisição e resposta da API.

Fonte: Resultados originais da pesquisa.

A Figura 2 apresenta um exemplo parcial da requisição e resposta da API, evidenciando a interface de interação do sistema. A requisição POST para o endpoint `/api/client/indicators/extract-from-pdf` exige dois parâmetros essenciais: `examUrl`, que é o endereço público do arquivo PDF contendo os exames, e `patientId`, um identificador do paciente previamente cadastrado. A necessidade de um link público para o PDF é uma implicação da arquitetura, permitindo que o serviço de processamento acesse e extraia o conteúdo. O `patientId` é crucial para estabelecer a associação correta entre os dados extraídos e o registro do paciente no banco de dados relacional, garantindo a integridade e a rastreabilidade das informações. A resposta da API, um JSON estruturado, inclui uma lista de resultados, onde cada item contém o `name` (nome do exame), `value` (valor numérico), `unit` (unidade de medida) e `measuredAt` (data e hora da medição). Essa estrutura padronizada é o cerne da solução, transformando dados não estruturados de um PDF em um formato facilmente manipulável por sistemas de informação em saúde. A capacidade de gerar essa saída padronizada é um avanço significativo em relação aos desafios de interoperabilidade e padronização de dados em saúde, frequentemente citados na literatura (Kellermann e Jones, 2013; Hom et al., 2022). A padronização dos dados facilita não apenas a integração com outros sistemas, mas também a realização de análises complexas, comparações temporais e a geração de visualizações que podem apoiar a tomada de decisão clínica.

Qualidade da Extração e Estruturação dos Dados

A qualidade da extração e estruturação dos dados é um pilar fundamental para a confiabilidade de qualquer sistema de informação em saúde. A padronização automática dos dados extraídos, um dos principais resultados do protótipo, contribuiu significativamente para uma maior uniformidade na representação das informações clínicas. Em contraste com o processo manual, onde variações de formato e nomenclatura são frequentes e dependem da interpretação individual do operador, o sistema automatizado impõe uma estrutura consistente. Essa padronização é vital para a integração eficaz dos dados a sistemas de gestão clínica e para a execução de consultas estruturadas no banco de dados, permitindo que as informações sejam acessadas e analisadas de forma eficiente e precisa. A ausência de padronização é um dos maiores entraves à interoperabilidade em saúde, e a solução proposta aborda diretamente esse problema, alinhando-se com as recomendações para melhorar a qualidade dos dados em sistemas de informação (Batini e Scannapieco, 2016).

Figura 3. Comparativo entre o PDF e a saída estruturada em JSON.

Fonte: Resultados originais da pesquisa.

A Figura 3 ilustra de forma clara o processo de transformação de dados brutos de um documento PDF para uma representação estruturada em JSON. O exemplo mostra um resultado de “Glicose” com valor “89” e unidade “mg/dL”, extraído de um contexto textual mais amplo no PDF. Essa correspondência direta entre o valor e a unidade de medida, juntamente com o nome do exame, demonstra a capacidade do protótipo de interpretar e organizar informações que, em sua origem, são não estruturadas ou semiestruturadas. A preservação da integridade dos dados, especialmente dos valores numéricos, é um aspecto crítico. Durante os testes, não foram identificados erros nos valores numéricos extraídos, o que reforça a confiabilidade do sistema na captura de dados quantitativos essenciais para o diagnóstico e acompanhamento clínico. A capacidade de converter informações de documentos PDF, que são notoriamente desafiadores para a extração automática devido à sua natureza não estruturada (Kaur e Singh, 2021), em um formato JSON padronizado é uma validação robusta da abordagem técnica empregada.

Apesar da alta precisão na extração de valores numéricos, foram observadas inconsistências pontuais na representação de unidades de medida e na nomenclatura de exames. Essas inconsistências decorreram principalmente de variações de formatação nos documentos de origem e de nuances na interpretação semântica do modelo de linguagem. Por exemplo, a unidade “mm3” poderia ser interpretada como “mm³”, ou a abreviação “u” como “μ”. Similarmente, a nomenclatura de exames como “VITAMINA D 25 DIHIDROXI” poderia ser padronizada para “Vitamina D”. Embora o impacto dessas inconsistências tenha sido classificado como baixo a médio, e a necessidade de correção como ocasional, elas apontam para a complexidade inerente à interpretação de linguagem natural e à variabilidade dos dados em saúde.

Tabela 1. Tipos de inconsistências identificadas na extração dos dados.

Exame

Unidade de medida

Hemoglobina

g/dL

Hematócrito

%

Leucócitos

/mm³

Plaquetas

/mm³

Eritrócitos

milhões/mm³

VCM

fL

HCM

pg

CHCM

g/dL

RDW

%

Glicose

mg/dL

Insulina

µIU/mL

Hemoglobina Glicada (HbA1c)

%

Ureia

mg/dL

Creatinina

mg/dL

Ácido Úrico

mg/dL

Colesterol Total

mg/dL

HDL Colesterol

mg/dL

LDL Colesterol

mg/dL

Triglicerídeos

mg/dL

AST (TGO)

U/L

ALT (TGP)

U/L

Gama GT

U/L

Cálcio

mg/dL

Magnésio

mg/dL

Sódio

mEq/L

Potássio

mEq/L

Bilirrubina Indireta

mg/dL

Bilirrubina Total

mg/dL

Bilirrubina Direta

mg/dL

Zinco

µg/dL

Proteína C Reativa (PCR)

mg/L

Ferro

µg/dL

Ferritina

ng/mL

Transferrina

mg/dL

Índice de Saturação da Transferrina (IST)

%

Vitamina B12

pg/mL

Vitamina D

ng/mL

Vitamina B6

μg/L

Ácido Fólico

ng/mL

TSH

µIU/mL

T3 Livre

pg/mL

T4 Livre

ng/dL

T3 Total

ng/dL

T4 Total

µg/dL

Testosterona Total

ng/dL

Testosterona Livre

ng/dL

SHBG

nmol/L

Cortisol Sérico

µg/dL

Lipase

U/L

Fonte: Resultados originais da pesquisa

A Tabela 1 detalha os tipos de inconsistências identificadas, como as variações em unidades de medida (e.g., “mm3 → mm³”, “u → μ”) e na nomenclatura de exames (e.g., “VITAMINA D 25 DIHIDROXI → Vitamina D”). O impacto dessas inconsistências foi avaliado como “Baixo” para unidades de medida e “Médio” para nomenclatura de exames, com a necessidade de correção classificada como “Não” ou “Ocasional”. Essa análise granular é fundamental para refinar o sistema e garantir a máxima precisão. Para mitigar essas inconsistências, implementou-se uma estratégia baseada no fornecimento de uma lista inicial de exames laboratoriais padronizados, incluindo suas nomenclaturas e unidades de medida corretas. Essa lista, que atua como um referencial prévio para o modelo de linguagem, demonstrou ser eficaz na redução ou eliminação da maior parte das inconsistências, resultando em uma saída estruturada mais uniforme. Essa abordagem ressalta a importância do conhecimento de domínio e da curadoria de dados no treinamento e aplicação de modelos de Inteligência Artificial em contextos específicos, como a saúde. A integração de um dicionário de termos padronizados é uma prática recomendada para aumentar a consistência e a interoperabilidade dos dados clínicos, conforme apontado por Batini e Scannapieco (2016).

Avaliação de Desempenho

A avaliação de desempenho do sistema revelou uma redução expressiva no tempo total de processamento em comparação com o fluxo manual de inserção de resultados. Para essa análise, foram utilizados cinco conjuntos de dados distintos, que variavam em número de páginas e na quantidade de valores numéricos, permitindo uma avaliação abrangente da robustez do sistema frente a diferentes complexidades documentais. O tempo do fluxo manual foi simulado pelo autor, que realizou a leitura dos arquivos PDF e a transcrição manual das informações (nome do exame, unidade de medida e valor) para uma planilha estruturada. O tempo total considerado para o processo manual abrangeu desde o início da leitura até a finalização completa da inserção dos dados, fornecendo uma base de comparação realista para os ganhos de eficiência.

Tabela 2. Comparativo de desempenho e eficiência dos processos.

Conjunto de dados

Nº de páginas

N° de valores

Tempo automatizado (s)

Tempo manual (s)

Ganho de eficiência (%)

Conjunto A

13

51

23

360

93,6

Conjunto B

11

35

15

252

94

Conjunto C

12

34

13

244,8

95,1

Conjunto D

9

32

12

230,4

94,4

Conjunto E

8

11

6

79,2

92,4

Fonte: Resultados originais da pesquisa

Conforme apresentado na Tabela 2, o tempo de processamento automatizado foi significativamente inferior ao manual em todos os cenários analisados, com ganhos de eficiência consistentemente superiores a 90%. Por exemplo, no Conjunto A, que representava o maior volume de dados (13 páginas e 51 resultados), o tempo de processamento manual foi de 360 segundos (6 minutos), enquanto o tempo automatizado foi de apenas 23 segundos, resultando em um ganho de eficiência de 93,6%. Este resultado é particularmente relevante, pois demonstra o potencial da solução em contextos com alta complexidade documental e grande volume de informações, onde o esforço manual se torna proibitivo. A redução substancial no tempo de execução, independentemente do volume de dados processados, é um indicador claro da eficácia da automação.

Considerando a média dos cinco conjuntos analisados, o tempo médio de processamento automatizado foi de aproximadamente 13,8 segundos, em contraste com os 233,3 segundos do processo manual. Isso se traduz em um ganho médio de eficiência de 93,9%. Esses números não apenas validam a viabilidade técnica da solução, mas também sublinham seu impacto transformador na eficiência operacional. A consistência do desempenho do sistema, com ganhos de eficiência acima de 90% em todos os cenários avaliados, mesmo com variações no número de páginas (de 8 a 13) e na quantidade de valores numéricos (de 11 a 51), sugere que o protótipo apresenta um comportamento previsível e estável. Essa previsibilidade é uma característica essencial para a adoção em ambientes clínicos, onde a consistência dos resultados e a confiabilidade do sistema são requisitos críticos para a segurança do paciente e a qualidade do atendimento.

Observou-se ainda que o tempo de processamento automatizado apresentou baixa sensibilidade ao aumento do volume de dados. Em outras palavras, o sistema manteve sua eficiência mesmo quando confrontado com documentos mais longos ou com mais resultados a serem extraídos. Em contrapartida, o processo manual demonstrou um crescimento proporcional ao número de páginas e de valores a serem digitados, o que significa que o esforço humano aumenta linearmente com a carga operacional. Esse comportamento reforça a vantagem da automação em contextos de maior demanda, onde o esforço humano tende a se tornar um gargalo significativo. Os achados indicam que a solução proposta possui um potencial considerável de escalabilidade e aplicabilidade prática em ambientes com alta demanda de processamento de exames laboratoriais, contribuindo para a otimização de fluxos de trabalho e a liberação de recursos humanos para tarefas de maior valor agregado.

A automação proposta pelo protótipo não apenas acelerou o processamento, mas também reduziu o retrabalho ao mitigar etapas manuais críticas, minimizando a reentrada de dados e a ocorrência de inconsistências. A substituição de tarefas repetitivas por fluxos sistêmicos não só acelera os processos, mas também reforça a integridade das informações, um aspecto crucial em sistemas de saúde. Os resultados confirmam a viabilidade técnica da solução e sua aderência aos objetivos do projeto de reduzir erros, retrabalho e tempo de processamento. A consistência dos impactos observados justifica a continuidade do estudo, com foco na consolidação de métricas quantitativas que permitirão avaliar a escalabilidade da ferramenta e seu suporte à tomada de decisão estratégica em um contexto mais amplo.

Os resultados obtidos neste estudo estão em consonância com a literatura que aponta a heterogeneidade de documentos em formato PDF como um dos principais desafios para a extração automatizada de informações, dada a ausência de padronização estrutural (Kaur e Singh, 2021). Nesse contexto, a utilização de modelos de linguagem para interpretação semântica mostrou-se uma abordagem altamente adequada para lidar com essa variabilidade, contribuindo para a estruturação consistente dos dados clínicos. A capacidade de transformar dados não estruturados em informações padronizadas e prontas para uso em sistemas de informação em saúde é um avanço significativo, que pode impactar positivamente a qualidade dos prontuários eletrônicos e a interoperabilidade entre diferentes plataformas de saúde. A solução proposta, portanto, não apenas resolve um problema técnico, mas também contribui para a melhoria da gestão da informação em saúde, um objetivo estratégico global (World Health Organization, 2019).

4. Conclusão

Conclui-se que o objetivo foi atingido, demonstrando a viabilidade técnica e operacional de uma solução baseada em Inteligência Artificial para a extração e integração estruturada de resultados de exames médicos em formato PDF. O protótipo desenvolvido automatizou com sucesso o fluxo de processamento, resultando em uma notável redução do tempo de execução, com ganhos médios de eficiência superiores a 90% em comparação com o processo manual. Essa automação minimizou a dependência de intervenções humanas, elevou a padronização dos registros e assegurou a integridade semântica dos dados extraídos, contribuindo significativamente para a qualidade dos prontuários eletrônicos e a interoperabilidade em sistemas de saúde.

Apesar dos avanços, o estudo apresenta limitações importantes. A avaliação foi conduzida em ambiente controlado e com um conjunto reduzido de documentos, o que restringe a generalização dos resultados para cenários reais de uso, com suas inerentes variabilidades. Adicionalmente, a dependência de serviços externos de Inteligência Artificial e a restrição a exames laboratoriais de sangue em PDF e em língua portuguesa limitam o escopo da análise. Para estudos futuros, sugere-se expandir a validação para bases de dados mais amplas e heterogêneas, explorar a aplicação da solução a outros tipos de documentos clínicos, como laudos de imagem, e investigar a implementação de modelos de IA internos para maior controle e reprodutibilidade, além de consolidar métricas quantitativas para avaliar a escalabilidade e o suporte à decisão estratégica.

Referências Bibliográficas

Almeida, R. M.; Souza, C. F.; Lima, F. C. 2024. Inteligência artificial na saúde: potencialidades, riscos e perspectivas para o Brasil. Disponível em: https://cetic.br/media/docs/publicacoes/7/20240903150639/estudos_setoriais-ia-na-saude.pdf. Acesso em: 17 set. 2025.

Bates, D. W.; Cohen, M.; Leape, L. L.; Overhage, J. M.; Shabot, M. M.; Sheridan, T. 2018. Reducing the frequency of errors in medicine using information technology. Journal of the American Medical Informatics Association.

Batini, C.; Scannapieco, M. 2016. Data and Information Quality: Dimensions, Principles and Techniques. Springer, Cham, Switzerland.

Fernández, E. B.; Yoshioka, N.; Washizaki, H.; VanHilst, M. 2020. Security Patterns in Practice: Designing Secure Architectures Using Software Patterns. Wiley, Hoboken, NJ, USA.

Fielding, R. T. 2000. Architectural styles and the design of network-based software architectures. Doctoral Dissertation, University of California, Irvine, USA.

Hom, J.; Nikowitz, J.; Ottesen, R.; Niland, J. C. 2022. Combining optical character recognition with natural language processing to extract performance status data from scanned electronic medical records. Journal of Biomedical Informatics. Disponível em: https://pubmed.ncbi.nlm.nih.gov/35608136/. Acesso em: 17 set. 2025.

Hripcsak, G.; Albers, D. J. 2015. Next-generation phenotyping of electronic health records. Journal of the American Medical Informatics Association.

Kaur, P.; Singh, M. 2021. A review of document analysis techniques for information extraction from PDF files. International Journal of Computer Applications, 174(20): 1–7.

Kellermann, A. L.; Jones, S. S. 2013. What it will take to achieve the as-yet-unfulfilled promises of health information technology. Health Affairs.

Wohlin, C.; Runeson, P.; Höst, M.; Ohlsson, M. C.; Regnell, B.; Wesslén, J. 2012. Experimentation in Software Engineering. Springer, Berlin, Germany.

World Health Organization. 2019. WHO guideline: recommendations on digital interventions for health system strengthening. World Health Organization, Geneva, Switzerland.

Yin, R. K. 2018. Case Study Research and Applications: Design and Methods. 6 ed. Sage Publications, Thousand Oaks, CA, USA.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

17 de setembro de 2026

Heterogeneidade Territorial do Bolsa Família: uma Análise por Clusters e Efeitos Fixos

O Programa Bolsa Família (PBF) representa uma das políticas de proteção social mais relevantes globalmente, o que justifica a investigação de seus efeitos diante das acentuadas e heterogêneas desigualdades regionais brasileiras. O estudo avaliou os reflexos socioeconômicos dos repasses do programa sobre a saúde, a educação e o mercado de trabalho nos municípios brasileiros, no período de 2004 a 2019. Para isso, aplicou-se a técnica de agrupamento K-means para segmentação territorial e estimaram-se modelos econométricos de dados em painel com efeitos fixos, tanto a nível nacional quanto segregados por clusters. Os resultados revelaram a natureza anticíclica do PBF no mercado de trabalho, com uma relação negativa entre repasses e vínculos empregatícios formais em quatro dos cinco clusters, sugerindo que os recursos foram mais intensos onde o mercado formal falhou. Na saúde, o programa associou-se à redução significante da mortalidade infantil evitável em municípios com maior equilíbrio socioeconômico, mas não apresentou efeito detectável em agrupamentos de maior precariedade estrutural, indicando que a transferência de renda é necessária, porém insuficiente sem infraestrutura de saúde funcional. Na educação, a análise por subperíodos mostrou atenuação progressiva do coeficiente nacional, refletindo a convergência das taxas de matrícula para um patamar de alta inércia temporal. Concluiu-se que o PBF cumpriu seu objetivo de proteção social de forma anticíclica e territorialmente focalizada, mas sua capacidade de transformar indicadores estruturais dependeu da sinergia com investimentos em infraestrutura pública.

Palavras-chave: Bolsa Família; Mortalidade Infantil; Municípios Brasileiros; Painel de Dados; Política Pública.

Gestão Tributária

17 de setembro de 2026

Limites Jurídicos e Práticos da Dedutibilidade Retroativa dos Juros sobre Capital Próprio

A gestão tributária adequada é crucial para a saúde financeira das empresas, especialmente no complexo sistema tributário brasileiro. Os Juros sobre Capital Próprio (JCP) constituem um mecanismo jurídico relevante para a remuneração do capital próprio, utilizado para otimizar a carga tributária. O estudo investigou a controvérsia sobre a dedutibilidade de JCP referentes a exercícios anteriores à deliberação societária que autoriza seu pagamento. Aplicou-se a metodologia de pesquisa e análise documental empírica, baseada em “Normative Systems”, para identificar cinco propriedades representativas dos argumentos jurídicos na jurisprudência administrativa e judicial. Analisaram-se acórdãos do Conselho Administrativo de Recursos Fiscais (CARF), revelando padrões decisórios predominantes, divergências interpretativas, incoerências argumentativas e significativa insegurança jurídica. Os resultados indicaram forte tendência de invalidação dos planejamentos envolvendo JCP extemporâneos na esfera administrativa. Contudo, o julgamento do Tema 1319 pelo Superior Tribunal de Justiça (STJ) seguiu direção oposta, consagrando tese favorável à dedutibilidade e estabelecendo um precedente paradigmático que pode influenciar a jurisprudência administrativa e redefinir os critérios decisórios.

Palavras-chave: CARF; gestão tributária; limitação temporal; lucro real; planejamento tributário.

17 de setembro de 2026

Símbolos da Moda Esportiva: Consumo, Identidade e Status entre Consumidores Brasileiros

A moda esportiva consolidou-se como linguagem simbólica de distinção social nas últimas décadas, impulsionada pela expansão do mercado de wellness e pela reconfiguração dos padrões de prestígio nas sociedades de consumo contemporâneas. O estudo objetivou compreender como os símbolos da moda esportiva influenciaram a construção de identidade e pertencimento e sua associação ao prestígio social entre consumidores brasileiros que adquiriram produtos do setor nos últimos 12 meses. Desenvolveu-se a pesquisa por meio de levantamento bibliográfico e pesquisa descritiva, com levantamento do tipo survey aplicado a uma amostra não probabilística por conveniência de 445 consumidores brasileiros de moda esportiva. Os principais resultados indicaram que a maioria dos respondentes associou marcas esportivas a percepções de status social; mais da metade reconheceu o wellness como novo símbolo de prestígio; e parcela expressiva percebeu o sportstyle como mais aceito em ambientes formais de trabalho. Em contrapartida, formas ostensivas de sinalização, como preferência por logotipos visíveis, influência de redes sociais e disposição a pagar sobrepreço, foram amplamente rejeitadas, revelando uma dissociação entre a atribuição simbólica de status e o comportamento de sinalização ostensiva. O consumidor brasileiro de moda esportiva com elevado capital cultural operou por meio de sinais simbólicos sutis e não ostensivos, compatíveis com o fenômeno do consumo inconspícuo, no qual a distinção social se manifestou de forma internalizada.

Palavras-chave: Consumo inconspícuo; Distinção; Prestígio social; Sportstyle; Wellness.

17 de setembro de 2026

Modelo Validado de Formação de Competência Técnica e Habilidades Não Técnicas em Indústrias Químicas Complexas

Analisou-se a implementação de um processo sistemático para o desenvolvimento e a atualização de competências técnicas e habilidades não técnicas em Operações Industriais e Segurança de Processo em uma indústria química de alta complexidade, pertencente a uma multinacional localizada no Polo Petroquímico de Camaçari, Bahia. O estudo objetivou implementar um processo mensurável e sustentável que assegurou a competência técnica e não técnica de 100% dos operadores, em conformidade com a legislação estadual da Bahia, diretrizes de institutos internacionais e políticas corporativas. A pesquisa caracterizou-se como um estudo de caso de abordagem mista, que envolveu diagnóstico documental, entrevistas semiestruturadas com 85 operadores experientes, análise de tarefas críticas e o desenvolvimento e aplicação piloto de um programa modular de treinamento. Este processo evidenciou a necessidade de alinhamento e atualização sistemática das competências requeridas. Os resultados obtidos indicaram a eficácia do modelo proposto, com 100% dos operadores concluindo os módulos teóricos e práticos e alcançando uma taxa de aprovação superior a 80%, além de conformidade operacional em campo. O trabalho contribuiu com um modelo estruturado de formação, incluindo matriz de competências, programas modulares de treinamento e diretrizes para certificação e recertificação, demonstrando potencial de replicação em outras unidades industriais de elevada complexidade e risco, e fortalecendo a segurança de processo e a sustentabilidade operacional.

Palavras-chave: Capacitação; Competência; Habilidades não técnicas; Segurança de processo; Treinamento.

Compliance E Esg

17 de setembro de 2026

Governança Pública Climática e Enchentes de 2024 no Rio Grande do Sul

As enchentes de 2024 no Rio Grande do Sul evidenciaram fragilidades estruturais na governança pública em um contexto federativo submetido a risco climático extremo. Este trabalho analisou, no recorte temporal de maio de 2024 a maio de 2025, como a atuação federal, estadual e municipal se estruturou diante da crise e em que medida a comparação com os Países Baixos ofereceu parâmetros úteis para o fortalecimento da resiliência institucional. A pesquisa adotou abordagem qualitativa, aplicada, exploratória e comparativa, com análise documental e análise de conteúdo de fontes oficiais, relatórios técnicos internacionais, atos normativos e pronunciamentos institucionais, organizados por categorias temáticas e interpretados com apoio do Modelo das Três Linhas do IIA. Os resultados mostraram que, embora os três níveis de governo tenham criado ou reestruturado instrumentos relevantes de coordenação e reconstrução após o desastre, prevaleceu uma institucionalidade reativa, posterior ao evento, com lacunas de continuidade administrativa, integração preventiva, monitoramento e accountability. Na comparação internacional, o modelo neerlandês destacou-se por combinar autoridade operacional permanente, base territorial clara, financiamento próprio e mecanismos mais robustos de monitoramento e responsabilização. Concluiu-se que os impactos das enchentes foram agravados menos pela ausência formal de normas e mais pela insuficiente articulação entre operação, gestão de riscos e controle. O fortalecimento da governança climática, no caso gaúcho, depende de institucionalizar coordenação, dados, financiamento e accountability em bases permanentes.

Palavras-chave: accountability; adaptação climática; gestão de riscos; governança multinível.

Digital Business

17 de setembro de 2026

Dados e Automação Utilizados em uma Campanha de Marketing na Engenharia Civil

A crescente utilização de dados no marketing digital impulsionou a adoção de estratégias mais orientadas por métricas e desempenho, com o Inbound Marketing em destaque. O uso de ferramentas de Business Intelligence (BI) mostrou-se fundamental para transformar dados em informações estratégicas, apoiando a tomada de decisão e a construção de bases de contatos qualificadas. Analisou-se como a ausência de integração entre sistemas de BI e plataformas de automação de marketing impactou a eficiência operacional e a efetividade das estratégias de Inbound Marketing em uma empresa de engenharia. Para isso, adotou-se uma abordagem descritiva de natureza qualitativa, baseada na análise dos processos operacionais envolvidos, desde a leitura de relatórios extraídos do BI e sua posterior transformação em mailings, até a preparação para importação no RD Station. Os resultados indicaram que o processo atual dependia de etapas manuais e empíricas, demandando tempo significativo. Identificaram-se limitações relacionadas à ausência de integração entre os sistemas, o que impactou diretamente a eficiência operacional e aumentou a dependência de atividades repetitivas. Concluiu-se que a estruturação adequada do processo de gestão de mailings e a integração entre BI e ferramentas de automação de marketing representam uma oportunidade para otimizar fluxos, melhorar a qualidade dos dados e fortalecer as estratégias de Inbound Marketing.

Palavras-chave: Automação de Marketing; Business Intelligence; Inbound Marketing; Integração de Sistemas; RD Station.

17 de setembro de 2026

Detecção de Anomalias no Monitoramento de Saúde de Pontes Usando Redes Neurais

O monitoramento da saúde estrutural de pontes tornou-se cada vez mais relevante diante do envelhecimento das infraestruturas e da intensificação de eventos extremos associados às mudanças climáticas. Nesse contexto, abordagens baseadas em dados destacaram-se como alternativas promissoras para o reconhecimento de anomalias. O estudo objetivou desenvolver e avaliar uma abordagem baseada em aprendizado de máquina para o reconhecimento de anomalias em séries temporais de aceleração estrutural. A metodologia adotada consistiu no uso de autoencoders treinados exclusivamente com dados representativos da condição íntegra, permitindo ao modelo aprender padrões associados ao estado saudável da estrutura; em seguida, o erro de reconstrução, quantificado por meio do erro quadrático médio (MSE), foi utilizado como critério para identificação de desvios em relação a essa condição. O conjunto de dados analisado foi composto por 1767 séries temporais de 1000 pontos cada, pertencentes a duas classes: íntegra (normal) e anômala (danificada). Os resultados obtidos demonstraram que o modelo proposto apresentou elevada capacidade de reconhecimento da classe anômala, com taxa de detecção superior a 90%, e desempenho global satisfatório, com área sob a curva ROC (AUC) próxima de 0,78, indicando boa capacidade discriminativa e reforçando o potencial da abordagem para aplicações em monitoramento estrutural.

Palavras-chave: Autoencoders; Detecção de Anomalias; Monitoramento de Pontes; Redes Neurais.

17 de setembro de 2026

Gestão Escolar Integrada: o Papel da Direção Administrativa na Capacitação da Equipe de Gestão Pedagógica para a Compreensão do Orçamento Escolar

A administração escolar foi abordada sob a perspectiva da integração entre gestores administrativos e pedagógicos, com foco na participação democrática, capacitação e qualificação dos atores. O objetivo geral consistiu na elaboração de um Guia de Orientações para Orçamento, direcionado à equipe de gestão pedagógica e mediado pela direção administrativa, visando instrumentalizar esses profissionais para a compreensão e participação nos processos financeiros e decisórios da instituição. Para tanto, o estudo desenvolveu-se em uma instituição particular privada, adotando uma abordagem qualitativa, descritiva e aplicada, com procedimento metodológico de estudo de caso. A pesquisa mapeou desafios práticos e dificuldades de comunicação entre os setores, analisou referenciais teóricos da gestão escolar e estruturou o instrumento formativo proposto. Os resultados demonstraram que a ausência de integração entre as áreas administrativa e pedagógica pode comprometer a efetividade da gestão escolar, evidenciando a necessidade de processos formativos contínuos que promovam entendimento mútuo, cooperação e construção coletiva de soluções. O Guia proposto fortaleceu a gestão democrática, elevou a qualificação da equipe pedagógica e melhorou os processos decisórios institucionais, destacando o papel formativo e estratégico do diretor administrativo.

Palavras-chave: Comunicação escolar; Gestão escolar participativa; Orçamento escolar.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade