Egresso do mestrado do DCC publica na Nature Scientific Reports técnica que reduz a complexidade de atenção em LLMs
O processamento de contextos extensos em Grandes Modelos de Linguagem (LLMs) demanda uma infraestrutura computacional de alto desempenho, especialmente devido à complexidade do mecanismo de autoatenção (self-attention), que cresce quadraticamente, em $O(N^2)$, conforme aumenta o número de tokens analisados. Esse comportamento limita o processamento de textos muito longos a sistemas equipados com grandes clusters de […]
O processamento de contextos extensos em Grandes Modelos de Linguagem (LLMs) demanda uma infraestrutura computacional de alto desempenho, especialmente devido à complexidade do mecanismo de autoatenção (self-attention), que cresce quadraticamente, em $O(N^2)$, conforme aumenta o número de tokens analisados. Esse comportamento limita o processamento de textos muito longos a sistemas equipados com grandes clusters de










