Índice:
- GPUs em rack e as mudanças na infraestrutura
- Por que a refrigeração convencional pode não bastar
- Como calcular o consumo elétrico do rack
- Capacidade do rack e o momento de revisar
- Quem deve participar do planejamento da instalação
- Monitoramento transforma sinais em decisões
- Erros que encarecem a expansão de GPUs
- Uma decisão segura começa antes da compra
Um servidor com GPUs pode ocupar o mesmo espaço físico que um servidor convencional, mas impõe exigências diferentes à infraestrutura. A concentração de processamento aumenta o consumo elétrico, libera mais calor e pode exigir outra estratégia para circulação de ar, distribuição de carga e manutenção. Quando esses fatores são tratados apenas depois da instalação, o rack tende a se tornar um ponto de estrangulamento da operação.
GPUs em rack são usadas para acelerar tarefas como inteligência artificial, análise de dados, renderização e computação em nuvem. Este artigo explica como planejar a refrigeração e a alimentação elétrica, quais sinais indicam que a estrutura precisa ser revista e por que o projeto deve envolver TI, facilities, engenharia elétrica e o fornecedor dos servidores.
GPUs em rack e as mudanças na infraestrutura
GPUs em rack são unidades de processamento gráfico instaladas em servidores montados em racks padrão de datacenter. Embora tenham surgido com força em aplicações gráficas, elas também executam cálculos paralelos exigidos pelo treinamento e pela inferência de modelos de inteligência artificial, por simulações, pelo processamento de grandes volumes de dados e por serviços de computação em nuvem.
A principal diferença em relação a uma instalação convencional está na densidade. Um servidor equipado com várias GPUs pode consumir muito mais energia que um equipamento destinado apenas a aplicações corporativas comuns. Com poucas exceções, toda essa energia acaba convertida em calor dentro da sala técnica. Por isso, o projeto precisa considerar simultaneamente a capacidade elétrica e a capacidade térmica.
Não basta verificar se o rack tem espaço livre em unidades de altura. É necessário saber quanto cada servidor consome em operação real, como o ar quente será removido, qual carga a régua de energia suporta, se há circuitos independentes e se a manutenção poderá ser realizada sem bloquear a circulação ou expor a equipe a riscos.
O uso aparece em diferentes cenários.
Inteligência artificial. Treinamento, ajuste e execução de modelos que demandam grande volume de operações matemáticas.
Análise de dados. Processamento paralelo de bases extensas, simulações e rotinas analíticas que podem ser aceleradas por GPU.
Renderização. Produção audiovisual, visualização arquitetônica, engenharia, efeitos visuais e outras tarefas gráficas.
Computação em nuvem. Oferta de máquinas virtuais ou serviços especializados com aceleradores compartilhados ou dedicados.
Em todos esses casos, a pergunta correta não é apenas quantas GPUs cabem no rack. O dimensionamento precisa responder quanto a instalação consome, quanto calor produz, em que regime trabalha e como continuará operando durante expansão, manutenção ou falha de um componente.
Por que a refrigeração convencional pode não bastar
Servidores com GPUs exigem uma análise térmica mais cuidadosa porque concentram componentes de alto consumo em pouco espaço. O ar frio precisa chegar à entrada dos equipamentos com temperatura e vazão adequadas. Ao mesmo tempo, o ar quente deve ser retirado sem retornar à frente do rack. Se esse caminho se mistura, a temperatura interna sobe mesmo quando a sala parece confortável.
O problema costuma começar com um sinal discreto, como ventoinhas trabalhando em rotação elevada, aumento da temperatura de entrada ou redução automática de desempenho. Muitos servidores e GPUs possuem mecanismos de proteção que diminuem a frequência de operação quando atingem limites térmicos. O equipamento continua ligado, mas entrega menos capacidade justamente quando a aplicação mais exige processamento.
A organização física do ambiente tem papel direto nesse resultado. Corredor frio e corredor quente, painéis de fechamento, vedação de espaços vazios e posicionamento correto dos cabos ajudam a evitar a recirculação de ar. Um rack parcialmente aberto, com áreas sem ocupação e passagem de cabos bloqueando a frente ou a traseira, pode prejudicar a distribuição mesmo quando o sistema de climatização possui capacidade nominal suficiente.
Também é preciso diferenciar a capacidade de refrigeração da sala da capacidade de remoção de calor na posição do rack. Um ambiente pode ter climatização adequada no total, mas apresentar pontos quentes próximos aos equipamentos de maior densidade. A medição deve ocorrer no local de entrada de ar dos servidores em diferentes condições de carga, e não apenas em um sensor instalado longe do rack.
Em instalações de maior densidade, o ar pode deixar de ser a única alternativa. Dependendo do servidor, da GPU, da concentração de equipamentos e das condições do datacenter, podem ser avaliadas soluções como contenção de corredores, unidades de refrigeração próximas ao rack, trocadores de calor na porta ou sistemas de resfriamento líquido. A escolha depende do projeto, da compatibilidade com os equipamentos, da manutenção disponível e da infraestrutura existente.
Como calcular o consumo elétrico do rack
O consumo do rack deve ser calculado a partir da carga real dos equipamentos, e não apenas da potência máxima escrita em uma etiqueta. A conta inicial é simples. Some a potência dos servidores, GPUs, armazenamento, switches e demais dispositivos instalados. Depois, considere as perdas de conversão, a margem de operação e o crescimento previsto.
Uma forma prática de organizar a estimativa é separar três valores.
Carga nominal. Soma das potências informadas para os equipamentos, útil para uma primeira avaliação.
Carga típica. Consumo observado durante a rotina normal de processamento.
Pico de carga. Valor que pode ocorrer em inicializações, treinamentos intensos, mudanças de carga de trabalho ou operação simultânea de vários servidores.
Por exemplo, se um rack reúne quatro servidores e cada um apresenta uma carga de 3 kW em determinado cenário, a carga dos servidores é de 12 kW. A esse valor ainda devem ser acrescentados switches, armazenamento, unidades de distribuição de energia e perdas do sistema. A estimativa final precisa respeitar a capacidade contínua dos circuitos, das PDUs, dos disjuntores, do nobreak e da alimentação disponível no local.
É importante não confundir watts com volt ampères. A potência ativa, medida em watts, representa o consumo efetivo. A potência aparente, medida em volt ampères, também considera o fator de potência da carga. A infraestrutura elétrica deve ser dimensionada com os parâmetros adequados do equipamento, especialmente quando há vários servidores chaveados e fontes redundantes.
Em corrente alternada monofásica, uma aproximação comum é calcular a corrente a partir da potência, da tensão e do fator de potência. Em sistemas trifásicos, a relação inclui a raiz de três. O dimensionamento definitivo deve ser feito por profissional habilitado, considerando a tensão local, o balanceamento entre fases, a capacidade dos condutores, os dispositivos de proteção, a temperatura e os requisitos aplicáveis ao ambiente.
Outro ponto frequentemente ignorado é a redundância. Um servidor com duas fontes pode estar ligado a duas PDUs, mas isso não significa automaticamente que qualquer uma delas consiga sustentar toda a carga em caso de falha da outra. O projeto deve verificar o comportamento esperado em cada cenário, incluindo operação normal, perda de uma fonte, manutenção de um circuito e transferência para o nobreak ou gerador.
Capacidade do rack e o momento de revisar
A capacidade do rack precisa ser revisada antes de uma expansão relevante, da troca de servidores por modelos com mais GPUs ou da alteração do perfil de uso. A revisão também é indicada quando aparecem alarmes de temperatura, sobrecarga em PDUs, disjuntores próximos do limite, desligamentos inesperados, aumento persistente da velocidade das ventoinhas ou queda de desempenho sob carga.
O espaço físico é apenas um dos limites. Um rack pode ter unidades de altura disponíveis e ainda não suportar a nova instalação por causa do peso, da profundidade dos servidores, da circulação de ar, da potência elétrica ou da capacidade de dissipação térmica. Equipamentos de GPU frequentemente exigem atenção especial à profundidade, ao fluxo de ar e ao acesso para manutenção.
A revisão deve considerar pelo menos quatro dimensões ao mesmo tempo. É preciso avaliar espaço, energia, calor e operação. Se uma delas estiver no limite, a expansão pode criar instabilidade mesmo que as outras pareçam adequadas.
Espaço e peso. Analise a altura disponível, a profundidade, os trilhos, o peso concentrado e o acesso frontal e traseiro. Ignorar esses fatores pode dificultar a instalação, causar deformação, bloquear a manutenção ou gerar incompatibilidade mecânica.
Energia. Verifique a potência contínua, os picos, os circuitos, as PDUs, as fontes redundantes e o balanceamento de fases. Ignorar esses itens pode provocar sobrecarga, desligamento, aquecimento de componentes e perda de redundância.
Refrigeração. Avalie a temperatura de entrada, a vazão de ar, a recirculação, os corredores e os pontos quentes. Sem esse cuidado, podem ocorrer redução de desempenho, alarmes térmicos e falhas prematuras.
Operação. Considere o monitoramento, o acesso, a manutenção, a expansão e a resposta a alarmes. Uma análise incompleta pode atrasar o diagnóstico e aumentar o tempo necessário para corrigir uma anomalia.
Uma boa prática é revisar o rack antes da compra, e não depois da entrega. As fichas técnicas devem ser comparadas com medições do ambiente e com a infraestrutura disponível. Quando os dados de consumo estão apresentados apenas como máximo ou típico, convém solicitar esclarecimentos ao fabricante e considerar os dois cenários no planejamento.
Quem deve participar do planejamento da instalação
O planejamento não deve ficar restrito à equipe que compra os servidores. A área de TI conhece a carga de trabalho, os horários de maior utilização, a necessidade de redundância e o crescimento esperado. Facilities ou operação predial avalia a climatização, o espaço, o acesso e as rotinas de manutenção. Já a engenharia elétrica verifica os circuitos, a proteção, o aterramento, a distribuição de fases e a compatibilidade com a alimentação existente.
O fabricante ou integrador dos servidores também tem papel relevante. Informações como direção do fluxo de ar, potência por configuração, exigência de fontes, limites de temperatura e necessidade de trilhos específicos podem mudar a decisão. Em aplicações críticas, a análise deve incluir o comportamento em caso de falha, e não apenas a operação normal.
Esse trabalho conjunto evita um erro comum. Um servidor pode ser compatível com o rack em termos mecânicos, mas incompatível com ele em termos elétricos ou térmicos. A compatibilidade real só existe quando o conjunto consegue operar, ser mantido e continuar protegido nas condições previstas.
Monitoramento transforma sinais em decisões
Temperatura e umidade não devem ser acompanhadas apenas durante uma inspeção eventual. Sensores posicionados de forma adequada, alertas personalizados e histórico de eventos ajudam a identificar tendências antes que elas provoquem indisponibilidade. A comparação entre temperatura de entrada, carga computacional e consumo elétrico é especialmente útil para localizar mudanças no comportamento do rack.
O monitoramento também precisa estar ligado a uma rotina de resposta. Um alerta de temperatura alta pode indicar aumento de carga, filtro obstruído, falha de ventilação, porta aberta, recirculação de ar ou problema no sistema de climatização. Sem contexto e registro histórico, a equipe tende a reagir apenas ao sintoma.
Racks inteligentes podem integrar controle de acesso, monitoramento ambiental e registro de eventos em uma mesma camada de gestão. Para ambientes com GPUs, isso ajuda a relacionar uma alteração física ou operacional ao momento em que o problema apareceu. A tecnologia não substitui o projeto térmico e elétrico, mas melhora a visibilidade sobre o que está acontecendo depois da instalação.
Erros que encarecem a expansão de GPUs
O primeiro erro é dimensionar pela média. A média de consumo pode esconder picos de processamento e não representa necessariamente o comportamento durante o treinamento de modelos, renderizações longas ou execução simultânea de várias cargas. O projeto precisa conhecer o pior cenário plausível e estabelecer uma margem coerente, sem transformar qualquer valor de etiqueta em consumo permanente.
Outro erro é usar a capacidade total da climatização como prova de que a refrigeração está resolvida. A distribuição do ar, a posição dos racks e a vedação dos corredores influenciam tanto quanto a potência nominal do equipamento de climatização.
Também é arriscado concentrar servidores de alta densidade em um único ponto sem verificar o peso, o circuito elétrico e a possibilidade de manutenção. Em alguns casos, distribuir a carga entre racks ou adotar uma solução de refrigeração localizada é mais seguro que simplesmente ocupar todos os espaços disponíveis.
Por fim, a redundância pode existir no papel e desaparecer na prática. Duas fontes conectadas ao mesmo circuito, duas PDUs alimentadas pela mesma origem ou um nobreak sem autonomia e capacidade compatíveis não oferecem a proteção imaginada. O desenho deve ser validado pelo caminho completo da energia.
Uma decisão segura começa antes da compra
GPUs em rack ampliam a capacidade de processamento, mas também tornam mais visíveis as limitações da infraestrutura. A escolha correta depende da relação entre carga computacional, consumo elétrico, dissipação de calor, redundância, manutenção e monitoramento. Nenhum desses fatores deve ser analisado isoladamente.
Antes de aprovar uma expansão, vale reunir as fichas técnicas, medir o consumo real quando possível, verificar a temperatura na entrada dos servidores e simular a perda de um circuito ou fonte. Essa preparação costuma revelar ajustes mais simples que uma troca emergencial de climatização ou uma intervenção elétrica feita com o ambiente já em produção.
A Smart Cabinet desenvolve racks inteligentes voltados à proteção e à gestão de ambientes de TI, com recursos de controle de acesso, monitoramento de temperatura, umidade e alertas personalizados. Para empresas em São Paulo e outros ambientes críticos, esse tipo de visibilidade pode apoiar uma avaliação mais organizada da infraestrutura antes da instalação ou expansão de servidores com GPUs.
Não perca mais tempo: fale AGORA com um especialista!
Tire suas dúvidas sobre rack inteligente em minutos e descubra como podemos ajudar você ainda hoje. Atendimento rápido e direto pelo WhatsApp.
QUERO FALAR NO WHATSAPP