The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining
Este artigo revela que o impacto ambiental do desenvolvimento de modelos de linguagem modernos é dominado pela experimentação pós-treinamento e por pipelines de raciocínio complexo — responsáveis por 82,2% da computação total e que tornam os modelos de raciocínio 17 vezes mais caros de pós-treinar do que os ajustados por instrução — destacando uma lacuna crítica e não relatada nos padrões atuais de relatórios ambientais.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Visão Geral: O Iceberg dos Custos da IA
Imagine que você está construindo uma fábrica massiva e de alta tecnologia para assar o bolo perfeito (um modelo de IA inteligente). Por anos, todos só contaram a eletricidade usada para assar o bolo final e colocaram esse número no rótulo.
Este artigo argumenta que isso é como olhar para um iceberg e contar apenas a ponta acima da água. Os autores foram para baixo da água para medir o iceberg inteiro. Eles descobriram que o "assar" do modelo final é, na verdade, uma parte minúscula da história. A verdadeira energia, as emissões de carbono e o uso de água ocorrem durante o processo bagunçado e experimental de descobrir como assar o bolo em primeiro lugar.
1. Os Modelos que "Pensam" Consomem muita Energia
Os pesquisadores estudaram uma nova família de modelos de IA chamada Olmo 3. Eles construíram dois tipos:
- O Modelo "Instruído": Segue ordens bem (como um assistente prestativo).
- O Modelo "Pensante": Resolve problemas complexos "pensando" através de etapas (como um matemático trabalhando em uma prova).
A Analogia:
Imagine que o modelo "Instruído" é um velocista. Ele corre uma curta distância e termina. O modelo "Pensante" é um maratonista que para para resolver quebra-cabeças ao longo do caminho.
- A Descoberta: Treinar o modelo "Pensante" exigiu 17 vezes mais energia do que o modelo "Instruído".
- Por quê? O modelo "Pensante" precisa gerar quantidades massivas de "tentativas de prática" (chamadas de rollouts) para aprender a raciocinar. É como um estudante que precisa escrever 100 redações de prática apenas para aprender a escrever uma boa. O artigo chama isso de "custo do pensamento".
2. O Custo "Oculto": Tentativa e Erro
A maior surpresa no artigo é sobre os custos de desenvolvimento.
- Antiga Crença: Pensávamos que a maior parte da energia era usada para a execução final de treinamento (o "exame final").
- Nova Realidade: 82% da energia total foi usada para experimentação. Isso inclui tentativas falhas, testes de configurações diferentes e experimentação com diferentes misturas de dados antes mesmo do modelo final ser construído.
A Analogia:
Pense nisso como um chef tentando criar um novo prato assinatura.
- O Prato Final: Aquele servido ao cliente (o modelo final).
- O Desenvolvimento: O chef queimando 100 panelas de sopa, jogando fora 50 batches de biscoitos e provando 20 misturas de especiarias diferentes para acertar.
- O Ponto do Artigo: Se você só contar a eletricidade usada para cozinhar o único prato final servido ao cliente, você está ignorando as 100 panelas de sopa que foram queimadas na cozinha. O artigo descobriu que, para a IA moderna, a "sopa queimada" (experimentos falhos) custa 5 vezes mais do que o prato final.
3. O Problema da Água: Não é Culpa do Data Center
O artigo também analisou o uso de água. Eles descobriram que o processo usou uma enorme quantidade de água (suficiente para uma pessoa beber por 140 anos).
A Analogia:
Muitas pessoas acham que a IA usa água porque os computadores esquentam e precisam ser resfriados com água (como um radiador de carro).
- A Realidade: O data center usou um sistema de "circuito fechado", o que significa que não perdeu água para resfriamento.
- O Verdadeiro Culpado: A água foi usada para gerar a eletricidade que alimentava os computadores. Usinas de energia (carvão, gás, nuclear) usam quantidades massivas de água para gerar a energia necessária para fazer a IA funcionar.
- A Lição: Se você quer economizar água, não basta apenas construir computadores melhores; você precisa mudar a forma como geramos a eletricidade que os alimenta.
4. A Conta Total
Quando os pesquisadores somaram tudo — o treinamento final, os experimentos falhos, a geração de dados e a fabricação de hardware — o custo total para construir os modelos Olmo 3 foi:
- Energia: Cerca de 12,3 milhões de quilowatts-hora (suficiente para alimentar 847 residências dos EUA por um ano inteiro).
- Carbono: Cerca de 4.251 toneladas de CO2.
- Água: Cerca de 15.887.000 litros.
Por Que Isso Importa
O artigo conclui que a maneira como relatamos atualmente o impacto ambiental da IA está quebrada. Estamos relatando apenas o custo da "execução final", o que faz o problema parecer muito menor do que realmente é.
À medida que os modelos de IA ficam mais inteligentes e exigem mais "pensamento" (raciocínio), e à medida que o processo de desenvolvimento se torna mais complexo, esses custos ocultos dispararão. Os autores estão pedindo aos desenvolvedores que parem de esconder a "sopa queimada" e comecem a relatar o custo total de toda a cozinha, não apenas da refeição final.
Em resumo: Construir IA inteligente é caro, mas o processo de descobrir como construí-la é ainda mais caro, e os modelos que "pensam" são os que mais consomem energia de todos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.