O processamento de contextos extensos em Grandes Modelos de Linguagem (LLMs) demanda uma infraestrutura computacional de alto desempenho, especialmente devido à complexidade do mecanismo de autoatenção (self-attention), que cresce quadraticamente, em $O(N^2)$, conforme aumenta o número de tokens analisados. Esse comportamento limita o processamento de textos muito longos a sistemas equipados com grandes clusters de GPUs, de elevado custo.
Uma pesquisa desenvolvida por Anderson R. Santos, egresso do mestrado do Programa de Pós-graduação em Ciência da Computação (PPGCC) do Departamento de Ciência da Computação (DCC) da UFMG, em 1999, e atualmente professor associado da Faculdade de Computação da Universidade Federal de Uberlândia (UFU), propõe uma alternativa algorítmica para reduzir esse custo. O método, denominado RIS (Reduced Interaction Sampling), reduz a complexidade do mecanismo de atenção de $O(N^2)$ para $O(N \log N)$. A abordagem utiliza amostragem estocástica baseada em propriedades topológicas de redes complexas para selecionar as interações mais relevantes durante o processamento.
A partir do método, foi desenvolvido o RIS-Kernel, um motor de inferência independente de modelo (model-agnostic) que introduz esparsidade no cálculo da atenção em tempo de execução. A abordagem permite reduzir o número de interações processadas sem a necessidade de retreinar os pesos neurais dos modelos. O estudo teórico foi publicado na revista Scientific Reports, do grupo Nature Portfolio, sob o DOI 10.1038/s41598-026-59160-z. Os testes de nível de sistema realizados com o RIS-Kernel também foram aceitos para apresentação e publicação nos anais da 25ª International Conference on Information & Knowledge Engineering (IKE’26). O vídeo da apresentação científica do trabalho está disponível publicamente no YouTube.
Os experimentos também avaliaram o desempenho do RIS-Kernel em servidores equipados exclusivamente com CPUs e com capacidade de memória entre 16 e 128 GB. Nos testes com o modelo Qwen2-1.5B-Instruct, a abordagem foi capaz de processar contextos extensos que levaram a atenção densa convencional a apresentar falha por falta de memória (Out-of-Memory, OOM). No teste com 65 mil tokens, a atenção densa não conseguiu concluir o processamento por esgotamento da memória física. Com o RIS-Kernel, o processamento foi concluído utilizando apenas 5% de densidade de atenção ativa e alcançando 62,50% de precisão na recuperação de informações factuais. Em uma janela de 32 mil tokens, o modelo alcançou 75,00% de acurácia com o RIS-Kernel, enquanto a abordagem densa utilizada como referência registrou 71,88%. Segundo os resultados apresentados no estudo, a redução das interações pode contribuir para filtrar parte dos ruídos presentes em textos extensos.
De acordo com Anderson Santos, os resultados atuais correspondem a uma prova de conceito desenvolvida em Python e PyTorch, utilizada para avaliar os limites de acurácia da técnica de amostragem. A próxima etapa da pesquisa prevê a implementação dos algoritmos em kernels de baixo nível, utilizando C++ ou Triton, com o objetivo de aumentar a velocidade da etapa de prefill, responsável pelo processamento inicial do contexto. A expectativa é que essa evolução permita integrar a tecnologia a runtimes de código aberto já utilizados pela comunidade, como o llama.cpp.
O código-fonte do wrapper e os conjuntos de dados utilizados nos experimentos estão disponíveis sob licença de software livre no GitHub do pesquisador.
INFORMAÇÕES DE REFERÊNCIA:
* DEMO do RIS-Kernel. Use sem instalar, pergunte em língua inglesa: https://huggingface.co/spaces/santosardr/ris-kernel-demo
* Vídeo de divulgação científica/explicativo: https://youtu.be/qQ1IwMU8uVA
* Vídeo de apresentação técnica para o congresso: https://youtu.be/paIP6V0pv8M
* Artigo RIS (Scientific Reports): https://doi.org/10.1038/s41598-026-59160-z
* Artigo RIS-Kernel (Preprint Zenodo aceito para publicação): https://doi.org/10.5281/zenodo.20476758
* Código no GitHub: https://github.com/santosardr/riskernel
* Divulgação na UFU: https://comunica.ufu.br/noticias/2026/07/inteligencia-artificial-sem-supercomputadores










