Inferência GPT-2 em C# puro com zero alocação por token
O projeto demonstra que é possível rodar modelos de linguagem com eficiência extrema em ambientes .NET, sem dependências externas. Para CTOs que operam em infraestrutura restrita ou edge computing, é uma referência técnica relevante de otimização.


