Article

October 09, 2026

Predição do MVP da NBA com Técnicas de Aprendizado de Máquina

Predição do Mvp da Nba com Técnicas de Aprendizado de Máquina

Marco Esposito Barthem; Renato Máximo Sátiro

DOI: 10.22167/2675-6528-202603234

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

O prêmio de Most Valuable Player (MVP) da NBA possui grande relevância no basquete profissional, refletindo o reconhecimento de atletas e os padrões de votação. Um estudo desenvolveu e avaliou modelos de aprendizado de máquina supervisionado para prever o prêmio MVP da NBA, tratando o problema como uma tarefa de ordenação baseada na estimação do valor de “Share” da votação. Foram treinados e avaliados cinco algoritmos – Random Forest, LightGBM, XGBoost, CatBoost e NGBoost – utilizando dados históricos da NBA de 1996 a 2025, coletados do portal “Basketball Reference”. Os modelos foram testados nas temporadas de 2019 a 2025. O CatBoost alcançou o melhor desempenho na acurácia Top-5 (77,14%), identificando consistentemente os cinco principais candidatos. Random Forest, LightGBM e NGBoost empataram na acurácia Top-1 (42,86%), prevendo corretamente o vencedor em três das sete temporadas avaliadas. A análise de importância das variáveis indicou que o desempenho ofensivo individual, especialmente pontos por partida, e o desempenho coletivo da equipe, representado pelo percentual de vitórias, foram os principais determinantes das previsões. Os resultados demonstraram a viabilidade da abordagem proposta e seu elevado potencial para estudos futuros.

Palavras-chave: Aprendizado de máquina; Boosting; NBA; Predição esportiva; Random Forest.

1. Introdução

A National Basketball Association (NBA) é reconhecida globalmente como a principal liga profissional de basquete, exercendo uma influência significativa tanto no esporte quanto na indústria global do entretenimento (Nguyen et al., 2022). Nas últimas décadas, a NBA consolidou-se como um empreendimento multibilionário, impulsionado pela expansão de sua audiência internacional, por contratos de mídia e por patrocínios comerciais. Na temporada 2024/25, a receita de patrocínio das equipes da liga apresentou um crescimento de oito por cento em relação à temporada anterior, atingindo 1,62 bilhão de dólares (Statista, 2025). Adicionalmente, os dez times mais valiosos da NBA somam, conjuntamente, um valor de mercado estimado em 58,9 bilhões de dólares, evidenciando a relevância econômica da competição (Forbes, 2024).

Nesse contexto, o prêmio de Most Valuable Player (MVP) representa uma das mais prestigiadas distinções individuais do esporte profissional. Ele é concedido anualmente ao atleta considerado o mais valioso da liga durante a temporada regular, em função de seu impacto e contribuição para o desempenho de sua equipe. A definição do MVP é realizada por meio de votação de jornalistas especializados, um processo que incorpora não apenas estatísticas objetivas de desempenho, mas também elementos subjetivos associados à narrativa da temporada e ao impacto percebido do jogador (Sport Makers, 2025).

Diante desse cenário, torna-se relevante investigar a possibilidade de empregar algoritmos de aprendizado de máquina para analisar e estimar a probabilidade de jogadores figurarem entre os principais candidatos ao prêmio de MVP, bem como identificar quais variáveis exercem maior influência no processo de votação. Tal abordagem apresenta potencial utilidade tanto para as franquias, ao subsidiar decisões estratégicas e avaliações de desempenho, quanto para os próprios atletas, ao fornecer insights sobre os fatores que mais contribuem para sua visibilidade e destaque individual ao longo da temporada.

Paralelamente, o avanço da ciência de dados e a crescente disponibilidade de bases estatísticas esportivas têm ampliado o uso de métodos quantitativos para análise e previsão de desempenho de atletas e equipes. A incorporação de técnicas de aprendizado de máquina ao contexto esportivo tem possibilitado avaliações mais robustas, especialmente em cenários caracterizados por múltiplas variáveis interdependentes e relações não lineares (Albert et al., 2017). Em particular, modelos do tipo ensemble, como RandomForest e Gradient Boosting, vêm sendo utilizados no basquete profissional, apresentando resultados consistentes tanto na previsão de desempenho individual quanto em métricas de popularidade e reconhecimento, como a seleção para o All-Star Game (Nguyen et al., 2022; Sports Illustrated, 2024).

A aplicação de técnicas de aprendizado de máquina à previsão do prêmio MVP apresenta potencial relevante, pois permite identificar padrões históricos associados a jogadores vencedores e projetar tais padrões para temporadas futuras, contribuindo para a compreensão dos fatores que influenciam o processo de votação (Nguyen et al., 2022). Portanto, o objetivo deste trabalho consiste em desenvolver e avaliar modelos de aprendizado de máquina voltados à previsão do prêmio de Most Valuable Player (MVP) da NBA, com foco na capacidade de identificar e ordenar corretamente os principais candidatos ao prêmio em cada temporada, bem como analisar os fatores que mais influenciam esse processo de decisão.

2. Material e Métodos

A metodologia adotada neste estudo foi estruturada com base no modelo Cross Industry Standard Process for Data Mining (CRISP-DM), que propõe um processo sistemático e iterativo para o desenvolvimento de projetos de ciência de dados (Shearer, 2000). As etapas de compreensão do negócio, compreensão dos dados, preparação dos dados, modelagem e avaliação foram contempladas. A fase de implantação não foi abordada, considerando o caráter acadêmico e exploratório da pesquisa.

A coleta de dados abrangeu informações históricas da National Basketball Association (NBA) para o período de 1996 a 2025. As informações foram obtidas do portal “Basketball Reference”, reconhecido na literatura como fonte pública e abrangente de estatísticas da liga (Belk et al., 2017; Basketball Reference, 2025). Utilizaram-se técnicas automatizadas de extração de informações, conhecidas como web scraping, implementadas em ambiente Python (Gheorghe et al., 2021).

Os dados coletados incluíram estatísticas individuais de jogadores, métricas agregadas de equipes e informações relacionadas à votação do “All-Star Game”. Estas últimas foram empregadas como um indicador de reconhecimento e visibilidade dos atletas, em conformidade com abordagens de estudos recentes sobre desempenho e popularidade na NBA (Nguyen et al., 2022). A coleta direta de múltiplas fontes especializadas foi necessária, visto que dados estatísticos detalhados em esportes não se encontram centralizados em bases governamentais (Watanabe; Shapiro; Drayer, 2021).

A fase de preparação dos dados seguiu as diretrizes do CRISP-DM, envolvendo procedimentos de limpeza, padronização, integração e transformação das bases coletadas (Shearer, 2000). As informações provenientes das diferentes tabelas do “Basketball Reference” foram consolidadas em uma base analítica única. A integração foi realizada utilizando o nome do jogador e o ano da temporada como chaves, garantindo a coerência dos registros individuais e coletivos ao longo do período analisado.

Foram selecionadas quatorze variáveis explicativas para a modelagem. Estas incluíram estatísticas individuais de desempenho dos jogadores, como média de minutos jogados por partida (MP), média de pontos (PTS), assistências (AST), rebotes (TRB), roubos de bola (STL), tocos (BLK), turnovers (TOV) e percentual efetivo de arremessos (eFG%).

Adicionalmente, foram incorporadas métricas coletivas associadas ao desempenho das equipes, como número de vitórias (W), percentual de vitórias (W/L%) e diferença média de jogos em relação ao líder da conferência (GB). Os votos recebidos dos fãs na votação do All-Star Game (Fans Votes) também foram incluídos como indicador de visibilidade e reconhecimento dos atletas.

A etapa de modelagem consistiu na seleção, configuração e avaliação de algoritmos de aprendizado de máquina supervisionado (Shearer, 2000). O objetivo foi estimar o valor de “Share” da votação associado a cada jogador, definido como a proporção dos votos recebidos em relação ao total possível em cada temporada. Esse valor contínuo foi utilizado para ordenar os atletas de forma decrescente, gerando um ranking dos principais candidatos ao prêmio.

O problema foi tratado sob o paradigma de “learning to rank”, que foca na qualidade da ordenação relativa entre os indivíduos avaliados, em vez da previsão pontual de um valor numérico (Li, 2011). Essa abordagem foi implementada por meio de modelos de regressão supervisionada, capazes de produzir escores contínuos para ordenação (Géron, 2022).

Foram empregados cinco algoritmos de aprendizado de máquina do tipo ensemble: Random Forest, LightGBM, XGBoost, CatBoost e NGBoost. Esses modelos foram selecionados por sua capacidade de modelar relações não lineares, capturar interações complexas entre variáveis e lidar eficientemente com dados tabulares, características comuns em análises de desempenho esportivo (Breiman, 2001; Friedman, 2001).

O Random Forest é um método baseado em árvores de decisão, que constrói múltiplas árvores independentes a partir de subconjuntos aleatórios dos dados e variáveis explicativas, agregando suas previsões para maior robustez (Breiman, 2001). Os algoritmos LightGBM, XGBoost, CatBoost e NGBoost são baseados no paradigma de Gradient Boosting, que combina sequencialmente modelos fracos para reduzir erros de previsão por meio de otimização iterativa (Chen & Guestrin, 2016; Ke et al., 2017; Dorogush et al., 2018; Duan et al., 2020).

Os modelos foram implementados em linguagem Python, utilizando as bibliotecas scikit-learn, LightGBM, XGBoost, CatBoost e NGBoost. Valores ausentes nas variáveis explicativas foram tratados por meio de imputação pela mediana, procedimento aplicado uniformemente a todos os algoritmos por meio de um pipeline de pré-processamento.

Os hiperparâmetros utilizados na configuração de cada modelo foram definidos com base em configurações de referência da literatura para problemas de regressão com dados tabulares, sem otimização sistemática. Para Random Forest, utilizaram-se 600 árvores e semente aleatória de 42. LightGBM e XGBoost foram configurados com 2000 estimadores, taxa de aprendizado de 0,03, subamostragem de 0,90 e fração de colunas de 0,90; XGBoost também incluiu profundidade máxima de 5 e regularização L2 de 1,0.

O CatBoost foi configurado com 3000 iterações, taxa de aprendizado de 0,03, profundidade máxima de 6 e função de perda RMSE. Para NGBoost, foram utilizados 1500 estimadores, taxa de aprendizado de 0,03, distribuição Normal e função de score MLE. Essa escolha de hiperparâmetros visou avaliar o potencial de cada abordagem em condições comparáveis (Géron, 2022).

A avaliação do desempenho dos modelos foi conduzida conforme a etapa de “Evaluation” do método CRISP-DM (Shearer, 2000). Os modelos foram treinados como regressões para prever o valor contínuo de “Share” da votação. A partir dessas previsões, os atletas foram ordenados de forma decrescente, gerando um ranking estimado para cada temporada.

A validação dos modelos foi realizada por meio de uma divisão temporal dos dados, respeitando a ordem cronológica das temporadas para evitar vazamento de informação. Os dados de 1996 a 2018 foram utilizados para treinamento, enquanto o período de 2019 a 2025 foi reservado como conjunto de teste. Todas as métricas reportadas referem-se a previsões realizadas fora da amostra de treinamento.

Como métricas de avaliação, foram utilizadas a acurácia Top-1 e a acurácia Top-5. A acurácia Top-1 verificou se o jogador classificado na primeira posição do ranking previsto correspondia ao vencedor real do prêmio em cada temporada. A acurácia Top-5 mediu o grau de sobreposição entre os cinco jogadores mais bem posicionados no ranking previsto e os cinco primeiros colocados na votação real, independentemente da ordem exata das posições.

3. Resultados e Discussão

A presente seção detalha e discute os resultados obtidos na avaliação dos modelos de aprendizado de máquina supervisionado, desenvolvidos para prever o valor de “Share” da votação do prêmio MVP da NBA e, consequentemente, ordenar os jogadores em cada temporada. A análise está estruturada em duas partes principais: a comparação do desempenho preditivo dos modelos com base nas métricas de acurácia Top-1 e Top-5, e a análise da importância relativa das variáveis explicativas em cada algoritmo, com foco nas diferenças entre as categorias de atributos consideradas. Os achados demonstram a viabilidade da abordagem e fornecem insights sobre os fatores que mais influenciam o processo de votação.

Comparação do Desempenho entre Modelos

Foram avaliados cinco modelos de aprendizado de máquina supervisionado — Random Forest, LightGBM, XGBoost, CatBoost e NGBoost — treinados com dados históricos da NBA de 1996 a 2018 e testados nas temporadas de 2019 a 2025. A avaliação utilizou as métricas de acurácia Top-1 e Top-5, calculadas a partir da ordenação decrescente do “Share” predito por cada modelo. A acurácia Top-1 verifica a capacidade do modelo de identificar corretamente o vencedor do prêmio, enquanto a acurácia Top-5 mensura a sobreposição entre os cinco principais candidatos previstos e os cinco primeiros da votação real, independentemente da ordem exata.

Os resultados da acurácia Top-1 revelaram um desempenho idêntico para Random Forest, LightGBM e NGBoost, que acertaram o vencedor em três das sete temporadas avaliadas, atingindo 42,86%. O CatBoost obteve um resultado ligeiramente inferior, com 28,57% de acertos, enquanto o XGBoost registrou o pior desempenho, acertando o vencedor em apenas uma temporada, com 14,29%. Este padrão indica que, para a identificação precisa do vencedor, as configurações utilizadas nos modelos de bagging e boosting não resultaram em ganhos preditivos significativamente distintos entre os algoritmos de melhor performance.

Na acurácia Top-5, o CatBoost demonstrou o melhor desempenho, alcançando 77,14%, o que significa que identificou consistentemente o grupo dos cinco principais candidatos em uma proporção superior das temporadas. Em seguida, o Random Forest obteve 71,43%, o LightGBM 68,57% e o NGBoost 65,71%. O XGBoost novamente apresentou o menor valor, com 62,86%. Essa métrica, por ser mais flexível, reflete a capacidade dos modelos de identificar o grupo de elite de jogadores, o que é crucial para a compreensão da dinâmica de votação do MVP.

A performance superior do CatBoost na acurácia Top-5 é um achado relevante, sugerindo que o algoritmo possui maior estabilidade durante o treinamento e incorpora mecanismos eficazes de redução de viés, conforme discutido por Dorogush, Ershov e Gulin (2018). Embora não tenha se destacado na identificação exata do vencedor (Top-1), sua consistência em prever o grupo dos principais candidatos é um indicativo de sua robustez na ordenação geral. Em contraste, o XGBoost apresentou o pior desempenho em ambas as métricas, o que pode ser atribuído à sua maior sensibilidade à configuração dos hiperparâmetros, que não foram otimizados formalmente neste estudo exploratório.

A análise comparativa entre as duas métricas de acurácia revela que nenhum modelo demonstrou domínio simultâneo em ambas as dimensões. Random Forest e LightGBM apresentaram um equilíbrio notável, com acurácia Top-1 idêntica (42,86%) e valores próximos para Top-5 (71,43% e 68,57%, respectivamente). Essa observação sugere que a escolha do modelo mais adequado depende do objetivo analítico específico: se a prioridade for a identificação exata do vencedor, Random Forest, LightGBM e NGBoost são mais vantajosos; se o foco for a identificação consistente do grupo de principais candidatos, o CatBoost se mostra mais apropriado. É fundamental considerar que o conjunto de teste, composto por apenas sete temporadas, limita a robustez estatística das comparações, e os hiperparâmetros foram definidos com base em valores de referência da literatura, sem otimização formal, o que oferece uma estimativa conservadora do potencial de cada abordagem.

Análise de Importância das Variáveis

Para aprofundar a interpretabilidade dos modelos e identificar os atributos que mais influenciaram as previsões, foram calculadas as importâncias relativas das variáveis explicativas para cada algoritmo. As importâncias foram normalizadas para totalizar 100% em cada modelo, permitindo uma comparação direta entre eles. Essa análise é crucial para compreender quais fatores são mais valorizados pelos algoritmos ao estimar o “Share” da votação do MVP, refletindo indiretamente os critérios de votação históricos.

No modelo Random Forest, a variável “PTS” (média de pontos por partida) concentrou a maior importância relativa, com 39,8%, seguida por “W/L%” (percentual de vitórias do time na temporada), com 20,8%. As demais variáveis apresentaram contribuições individuais inferiores a 7%, com “Fans Votes” (votos recebidos dos fãs na votação do All-Star Game) e “AST” (média de assistências por partida) em destaque, com 6,8% e 6,7%, respectivamente. Esse padrão indica que o Random Forest atribui um peso predominante ao desempenho ofensivo individual do jogador e ao contexto coletivo de sucesso da equipe, o que é consistente com a percepção geral sobre os critérios de votação do MVP.

O LightGBM apresentou uma distribuição de importâncias distinta, com “Fans Votes” ocupando a primeira posição, com 16,0%, à frente de “PTS” (14,6%) e “AST” (13,1%). Esse comportamento pode ser associado à forma como o algoritmo pondera variáveis com distribuições assimétricas, onde a concentração de votos em jogadores de alto perfil pode amplificar a relevância percebida internamente. A popularidade, capturada pelos “Fans Votes”, emerge como um fator significativo para este algoritmo, sugerindo que a visibilidade e o reconhecimento público desempenham um papel considerável em suas previsões.

No XGBoost, a variável “W/L%” assumiu a maior importância, com 32,1%, seguida por “PTS”, com 23,9%. Este foi o único modelo em que um indicador de desempenho coletivo superou o desempenho ofensivo individual na primeira posição. Esse padrão pode estar relacionado ao desempenho inferior do XGBoost na acurácia Top-1, pois, embora o sucesso da equipe seja relevante, a diferenciação final entre os principais candidatos ao MVP frequentemente depende de estatísticas individuais de destaque. A atribuição de um peso excessivo ao contexto coletivo pode ter reduzido a sensibilidade do modelo às nuances do protagonismo ofensivo individual.

O CatBoost demonstrou uma estrutura de importâncias semelhante à do Random Forest, com “PTS” liderando com 32,1%, seguido por “W/L%” com 20,5% e “Fans Votes” com 9,2%. O equilíbrio entre o desempenho ofensivo individual e o contexto coletivo da equipe é consistente com o bom desempenho desse modelo na acurácia Top-5. Essa distribuição equilibrada sugere que o CatBoost consegue capturar a interação entre a performance individual e o sucesso da equipe, que são fatores cruciais para a identificação dos principais candidatos ao prêmio.

O NGBoost, por sua vez, apresentou uma distribuição de importâncias mais equilibrada entre os atributos, sem a dominância expressiva de uma única variável. “PTS” liderou com 24,1%, seguido por “AST” com 14,0% e “MP” (média de minutos jogados por partida) com 12,6%. O peso expressivo dos minutos jogados, não observado com a mesma magnitude nos demais algoritmos, é coerente com a abordagem probabilística do modelo, que tende a distribuir a influência preditiva de forma mais difusa ao modelar a incerteza sobre a estimativa central. Isso indica que o NGBoost considera uma gama mais ampla de indicadores de protagonismo estatístico.

Ao agregar as importâncias por categoria de variáveis, observou-se que, em todos os modelos, as variáveis ofensivas individuais concentraram a maior parcela da importância relativa. No Random Forest, essa categoria representou aproximadamente 53,9% da importância total, seguida pelo desempenho coletivo da equipe, com 28,1%. Uma estrutura similar foi observada no CatBoost, onde as variáveis ofensivas corresponderam a cerca de 50,6% e o desempenho da equipe a 27,8%. Essa distribuição equilibrada entre produção ofensiva e contexto coletivo é consistente com o desempenho superior desses modelos nas métricas de ordenação, sugerindo que a combinação de ambos os fatores é essencial para a identificação dos principais candidatos.

Em contrapartida, as variáveis defensivas — rebotes, roubos de bola e tocos — apresentaram importância consideravelmente inferior à das variáveis ofensivas em todos os modelos avaliados. Embora a contribuição defensiva não tenha sido nula, atingindo aproximadamente 20% da importância total em alguns modelos, sua influência nas previsões foi substancialmente menor do que o desempenho ofensivo. Essa disparidade sugere uma assimetria de visibilidade no processo de votação do MVP: jogadores com perfil predominantemente ofensivo tendem a ter maior projeção pública e midiática, mesmo que jogadores defensivos contribuam de forma equivalente para as vitórias da equipe. Os modelos, ao serem treinados com padrões históricos de votação, reproduzem esse viés, indicando que o prêmio MVP pode valorizar mais a contribuição visível e comunicável do que o impacto total do jogador.

Em síntese, os resultados demonstram que a abordagem proposta é viável e apresenta elevado potencial de evolução para a predição do prêmio MVP da NBA. A combinação de modelos de aprendizado supervisionado e métricas específicas de ordenação mostrou-se adequada para analisar a dinâmica da votação. Os achados revelam que o desempenho ofensivo individual, especialmente a média de pontos por partida, e o desempenho coletivo da equipe, representado pelo percentual de vitórias, são os principais determinantes das previsões em todos os modelos avaliados. Os algoritmos que mantiveram um equilíbrio entre essas duas dimensões, como Random Forest e CatBoost, foram os que melhor reproduziram a lógica subjacente à votação do prêmio, enquanto aqueles que concentraram excessivamente o peso em uma única dimensão, como o XGBoost no contexto coletivo, apresentaram maior dificuldade em distinguir com precisão o vencedor entre os principais candidatos.

4. Conclusão

O estudo buscou desenvolver e avaliar modelos de aprendizado de máquina supervisionado para prever o prêmio de Most Valuable Player (MVP) da NBA, abordando o problema como uma tarefa de ordenação baseada na estimação do valor de “Share” da votação, e analisar os fatores que mais influenciam esse processo. Verificou-se que os cinco algoritmos avaliados — Random Forest, LightGBM, XGBoost, CatBoost e NGBoost — demonstraram capacidade de identificar, ao menos parcialmente, os principais candidatos ao prêmio. O CatBoost destacou-se na acurácia Top-5, com 77,14%, ao identificar consistentemente o grupo dos cinco principais jogadores. Para a acurácia Top-1, Random Forest, LightGBM e NGBoost empataram em 42,86%, prevendo corretamente o vencedor em três das sete temporadas testadas. A análise de importância das variáveis revelou que o desempenho ofensivo individual, particularmente a média de pontos por partida, e o desempenho coletivo da equipe, representado pelo percentual de vitórias, foram os principais determinantes das previsões em todos os modelos. Os algoritmos que mantiveram um equilíbrio entre essas duas dimensões, como Random Forest e CatBoost, reproduziram com maior fidelidade a lógica subjacente à votação do prêmio. A principal contribuição do estudo reside na demonstração da viabilidade da aplicação de técnicas de aprendizado de máquina para analisar e estimar a probabilidade de jogadores figurarem entre os principais candidatos ao prêmio MVP, fornecendo insights valiosos para franquias e atletas sobre os fatores que mais contribuem para o reconhecimento individual.

Contudo, a presente pesquisa possui limitações que devem ser consideradas. O conjunto de teste reduzido, composto por apenas sete temporadas, restringe a robustez estatística das comparações entre os modelos. Adicionalmente, os hiperparâmetros foram definidos com base em valores de referência da literatura, sem otimização formal, o que implica que os resultados representam uma estimativa conservadora do potencial de cada abordagem. O conjunto de variáveis explicativas, embora representativo, não incorporou estatísticas avançadas de desempenho, como métricas de impacto ajustadas por adversário ou indicadores de eficiência em momentos decisivos das partidas. Para estudos futuros, sugere-se a otimização formal dos hiperparâmetros, a incorporação de estatísticas avançadas e variáveis contextuais, como a narrativa da temporada e lesões de concorrentes, e a exploração de abordagens específicas de aprendizado de ranking, em substituição à regressão indireta, para aprimorar a precisão e a interpretabilidade dos modelos preditivos.

Referências Bibliográficas

Albert, J.; Glickman, M. E.; Swartz, T.; Koning, R. H. 2017. Handbook of Statistical Methods and Analyses in Sports. 1 ed. CRC Press, Boca Raton, FL, USA.

Basketball Reference. 2025. NBA Statistics and History. https://www.basketball-reference.com/. Acesso em: 05 out. 2025.

Belk, J. W.; Marshall, H. A.; McCarty, E. C.; Kraeutler, M. J. 2017. The Effect of Regular-Season Rest on Playoff Performance Among Players in the National Basketball Association. Orthopaedic Journal of Sports Medicine, v. 5, n. 10. SAGE Publications, Thousand Oaks, CA, USA. DOI: https://doi.org/10.1177/2325967117729798.

Breiman, L. 2001. RandomForests. Machine Learning, v. 45, n. 1, p. 5–32. Springer, New York, NY, USA. DOI: https://doi.org/10.1023/A:1010933404324.

Chen, T.; Guestrin, C. 2016. XGBoost: A Scalable Tree Boosting System. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. ACM, San Francisco, CA, USA. DOI: https://doi.org/10.1145/2939672.2939785.

Dorogush, A. V.; Ershov, V.; Gulin, A. 2018. CatBoost: Gradient Boosting with Categorical Features Support. In: Proceedings of the 32nd Conference on Neural Information Processing Systems (NeurIPS). Montréal, QC, Canada.

Duan, T.; Avati, A.; Ding, D.; Basu, S.; Ng, A.; Wang, Y. 2020. NGBoost: Natural Gradient Boosting for Probabilistic Prediction. In: Proceedings of the 37th International Conference on Machine Learning (ICML). PMLR, Vienna, Austria.

Forbes. 2024. NBA Team Valuations: The Business of Basketball. https://www.forbes.com/nba-valuations/list/#tab:overall. Acesso em: 30 set. 2025

Friedman, J. H. 2001. Greedy Function Approximation: A Gradient Boosting Machine. Annals of Statistics, v. 29, n. 5, p. 1189-1232. Institute of Mathematical Statistics, Beachwood, OH, USA. DOI: https://doi.org/10.1214/aos/1013203451.

Gheorghe, M.; Duma, O.; Cherciu, M. 2021. Modern Techniques of Web Scraping for Data Scientists. 1 ed. Romanian Review of Informatics and Automatic Control, Bucharest, Romania.

Géron, A. 2022. Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow. 3 ed. O’Reilly Media, Sebastopol, CA, USA.

Ke, G.; Meng, Q.; Finley, T.; Wang, T.; Chen, W.; Ma, W.; Ye, Q.; Liu, T.-Y. 2017. LightGBM: A Highly Efficient Gradient Boosting Decision Tree. In: Advances in Neural Information Processing Systems 30 (NIPS). Long Beach, CA, USA.

LI, H. 2011. Learning to Rank for Information Retrieval. Berlin: Springer.

Nguyen, T.; Tran, P.; Wang, Y.; Liu, Z. 2022. The application of machine learning and deep learning in sport: predicting NBA players’ performance and popularity. Journal of Ambient Intelligence and Humanized Computing, 13: 7597–7609. https://doi.org/10.1007/s12652-021-03687-8.

Shearer, C. 2000. The CRISP-DM model: The new blueprint for data mining. Journal of Data Warehousing, 5(4): 13-22. https://mineracaodedados.wordpress.com/wp-content/uploads/2012/04/the-crisp-dm-model-the-new-blueprint-for-data-mining-shearer-colin.pdf. Acesso em: 05 out. 2025.

Sport Makers. 2025. NBA MVP Voting: Who Casts the Ballots? https://www.sportmakers.co.uk/nba-mvp-voting-who-casts-the-ballots/. Acesso em: 28 set. 2025.

Sports Illustrated. 2024. NBA All-Star voting rules explained: Timeline, stages, eligible players. https://www.si.com/nba/nba-all-star-voting-rules-explained-timeline-stages-eligible-players-01jfmtqhew6b. Acesso em: 30 set. 2025.

Statista. 2025. National Basketball Association team sponsorship revenue from 2019/20 to 2024/25 https://www.statista.com/statistics/380270/nba-sponsorship-revenue/. Acesso em: 30 set. 2025.

Watanabe, N. M.; Shapiro, S.; Drayer, J. 2021. Big Data and Analytics in Sport Management. Journal of Sport Management, 35(3): 197–202. https://doi.org/10.1123/jsm.2021-0067.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

You may also like

October 09, 2026

Baixa Produção de Conteúdo Gerado Pelo Usuário em Colaborações de Cosméticos nas Plataformas Digitais

Este estudo analisou a relação entre colaborações de marcas, conhecidas como “collabs”, no setor de cosméticos e a produção de conteúdo gerado pelo usuário (UGC) em plataformas digitais. A pesquisa abordou a relevância do tema diante do crescimento do mercado de beleza e da intensificação das estratégias de “co-branding” como ferramenta de diferenciação e inovação. O objetivo principal foi compreender de que forma essas colaborações influenciaram o comportamento do consumidor digital, com foco na criação de UGC e na intenção de compra. Para isso, a metodologia adotada foi exploratória e descritiva, com a aplicação de um questionário online a 493 respondentes da região Sudeste do Brasil. Os dados coletados foram analisados por meio de estatística descritiva. Os resultados indicaram que, embora as “collabs” gerassem engajamento entre os consumidores, a produção de UGC ativo foi baixa, predominando interações passivas como curtidas, salvamentos e reações rápidas. Adicionalmente, as colaborações demonstraram influência limitada na intenção de compra e na disposição a pagar mais pelos produtos. Concluiu-se que, apesar do potencial estratégico das “collabs” para o mercado de cosméticos, sua efetividade dependeu de fatores como a relevância percebida, a identificação com a marca e a presença de estímulos adicionais para a criação de conteúdo pelo usuário.

Palavras-chave: Comportamento online; Co-branding; Engajamento do consumidor; Intenção de compra; Interação digital.

October 09, 2026

Ferramentas e técnicas de gestão do tempo utilizadas por técnicos da capacitação profissional rural e promoção social

A gestão do tempo configura-se como um elemento essencial para a melhoria da produtividade e da qualidade das entregas, ao permitir a organização, priorização e execução eficiente das atividades, contribuindo diretamente para o alcance de metas e a otimização dos resultados no contexto profissional e pessoal. Objetivou-se compreender como práticas, ferramentas e técnicas de gestão do tempo, adotadas por instrutores de formação profissional rural e de promoção social, se associaram a dois desfechos centrais: a realização das atividades diárias planejadas e a percepção do impacto dessas práticas no bem-estar e produtividade. Os dados foram coletados por meio de questionário on-line estruturado, composto por 18 questões, e as análises foram realizadas no ambiente Python com bibliotecas estatísticas. Os resultados revelaram que a elevada formação acadêmica e maturidade profissional não se traduziu em maior eficácia na gestão do tempo. Observou-se amplo conhecimento sobre ferramentas e técnicas, mas sua utilização prática foi limitada e desigual. Ferramentas mais simples e intuitivas, como listas de tarefas, apresentaram maior adesão, enquanto técnicas que exigem transformações comportamentais, como a Técnica Pomodoro, tiveram baixa aplicação. Houve predominância do uso de soluções digitais, com destaque para o Google Agenda. Evidenciou-se uma percepção quase unânime de que a gestão do tempo influencia diretamente a produtividade e o bem-estar. Concluiu-se que a melhoria da gestão do tempo não dependeu exclusivamente da adoção de ferramentas e técnicas, mas, sobretudo, do desenvolvimento de habilidades práticas e comportamentais, aliado a ajustes nas condições de trabalho.

Palavras-chave: 5W2H; Matriz de Eisenhower; Matriz GUT; Multitarefa; Procrastinação.

October 09, 2026

Análise de Correspondência Aplicada a Dados Periciais: Identificação de Padrões Para Melhoria dos Serviços de Atendimento

A necessidade de otimizar recursos e compreender a complexa dinâmica criminal motivou a exploração de dados periciais, frequentemente subutilizados em laudos textuais. Aplicou-se a Análise de Correspondência Múltipla (ACM) em atendimentos periciais na Macrorregião de Bauru, SP. O objetivo foi investigar e identificar padrões de associação entre o tipo de ocorrência, o período do dia, o dia da semana e a localização, visando subsidiar decisões operacionais. Utilizaram-se dados da Superintendência da Polícia Técnico-Científica (SPTC), coletados entre maio de 2023 e janeiro de 2026. A metodologia englobou a limpeza, transformação e categorização das variáveis, além da construção de matrizes de contingência processadas em Python. A análise descritiva inicial revelou que furtos e colisões predominaram no volume total de ocorrências, enquanto crimes violentos, como homicídios, estupros e feminicídios, representaram uma parcela menor, mas demandaram tempos de resposta significativamente maiores. A ACM mapeou visualmente as correlações estruturais, demonstrando associações claras entre crimes noturnos e de finais de semana com regiões específicas. Identificaram-se dois agrupamentos principais: um perfil noturno e de fim de semana, associado a choques, atropelamentos e suicídios, com destaque para Bauru; e um perfil diurno em dias úteis, dominado por furtos e danos à propriedade. Demonstrou-se que o uso de técnicas exploratórias de aprendizado de máquina transformou dados periciais brutos em informações estratégicas vitais, fornecendo subsídios para a alocação eficiente de equipes e fundamentando a elaboração de políticas públicas baseadas em evidências.

Palavras-chave: Crimes violentos; Matriz de contingência; Priorização de serviços; Python; Tempos de resposta.

October 09, 2026

O comportamento das gerações de consumidores digitais de materiais para construção: análise da Geração X

Analisou-se o comportamento da Geração X na compra de materiais para construção, considerando a articulação entre canais digitais e físicos e as percepções de varejistas e indústrias sobre esse processo. O objetivo foi investigar como esse público utiliza os canais digitais e físicos no processo decisório e relacionar os achados às respostas de varejistas e indústrias. Realizou-se uma pesquisa descritiva e exploratória, com abordagem quantitativa e interpretação qualitativa, por meio de três questionários aplicados a 37 consumidores, 25 varejistas e 25 representantes da indústria. Os dados de cada grupo foram analisados separadamente e, em seguida, relacionados por eixos temáticos. Os resultados indicaram que os consumidores da Geração X utilizam meios digitais para pesquisa e comparação, mas valorizam a loja física para contato com o produto, confiança e atendimento consultivo. Os varejistas reconheceram a transformação, mas apresentaram diferentes níveis de adaptação, enquanto as indústrias relataram uso heterogêneo de tecnologias e reconheceram seu papel de apoio ao varejo. Concluiu-se que o comportamento da Geração X se caracteriza por uma jornada híbrida, que exige maior integração entre os canais e os agentes da cadeia de materiais para construção.

Palavras-chave: Comportamento do consumidor; Geração X; Jornada de compra híbrida; Transformação digital; Varejo de materiais para construção.

Neuroscience And Learning In Education

October 09, 2026

Fundamentos para estruturação de currículos baseados em habilidades de raciocínio

Nas últimas décadas, observou-se uma transição educacional de modelos focados em conteúdo para o desenvolvimento de competências, impulsionada pela ubiquidade da informação. Nesse contexto, as habilidades de raciocínio tornaram-se pedagogicamente cruciais por embasarem a compreensão, relação e adaptação de conteúdos em cenários complexos. Com base nessa perspectiva, buscou-se consolidar um modelo detalhado das habilidades que compõem o raciocínio cognitivo, visando servir de base para a elaboração de currículos e programas pedagógicos. Para tanto, realizou-se uma pesquisa qualitativa e exploratória, que envolveu uma síntese multidisciplinar de conhecimentos da filosofia da mente, epistemologia, semiótica, psicologia cognitiva e neurociência. Essa abordagem proporcionou uma visão abrangente da natureza e das funções do raciocínio humano. O modelo resultante classificou as habilidades em quatro funções cognitivas principais, subdivididas em níveis crescentes de complexidade, que acompanharam o desenvolvimento cognitivo humano. A estrutura final mostrou-se bem fundamentada e aplicável à elaboração de currículos e programas pedagógicos, oferecendo uma taxonomia de habilidades do raciocínio diretamente utilizável no sequenciamento instrucional e na avaliação de competências cognitivas.

Palavras-chave: Currículo baseado em competências; Desenvolvimento cognitivo; Habilidades cognitivas; Pensamento crítico; Raciocínio cognitivo.

Tax Management

October 09, 2026

Criptomoedas como ativo de investimento: riscos e oportunidades para o investidor brasileiro

A crescente inserção das criptomoedas no mercado financeiro e as incertezas sobre seu papel em carteiras de investimento motivaram este estudo. Analisou-se as criptoativos, com foco em Bitcoin e Ethereum, como ativos de investimento, avaliando seus impactos no risco e retorno de carteiras compostas por ativos tradicionais para o investidor brasileiro. A metodologia baseou-se na Teoria Moderna de Portfólios, simulando carteiras com diferentes níveis de alocação em criptoativos (0%, 5%, 10% e 20%) utilizando dados diários de janeiro de 2018 a dezembro de 2024. Calcularam-se métricas de desempenho, como retorno médio anualizado, volatilidade e índice de Sharpe, além de medidas de risco, incluindo Value at Risk e Conditional Value at Risk, e realizou-se uma avaliação dinâmica por janelas móveis de 252 dias úteis. Os resultados indicaram que a inclusão de criptoativos contribuiu para a melhoria da relação risco-retorno das carteiras. Verificou-se, contudo, que o ganho em desempenho ajustado ao risco foi acompanhado por elevação desproporcional da volatilidade e da exposição a perdas extremas, configurando um trade-off entre eficiência e risco absoluto. Níveis moderados de alocação (5% a 10%) mostraram-se mais compatíveis com o perfil do investidor brasileiro. As evidências sugeriram que os criptoativos podem ser utilizados como instrumento de diversificação em carteiras de investimento, desde que sua alocação seja realizada de forma criteriosa e compatível com o perfil de risco do investidor.

Palavras-chave: Alocação de ativos; Ativos digitais; Diversificação de portfólio; Índice de Sharpe; Teoria moderna de portfólios.