Ceph: storage distribuído unificado (block, object, file) para datacenter

Ceph é uma plataforma de storage distribuído open-source que unifica block, object e file storage em um cluster único e escalável. Foi criado por Sage Weil em 2003 na Universidade da Califórnia em Santa Cruz (UCSC) como parte de seu doutorado, com o artigo seminal publicado na conferência OSDI em 2006. Em 2014, a Red Hat adquiriu a Inktank (empresa fundada por Weil) por US$ 175 milhões, e desde 2018 o projeto é governado pela Ceph Foundation, hospedada pela Linux Foundation.

TL;DR

  • Ceph é uma plataforma open-source de storage distribuído que fornece block (RBD), object (RGW compatível com S3) e file (CephFS) em um único cluster.
  • Usa o algoritmo CRUSH para distribuir dados sem servidor central de metadados, permitindo escalar linearmente para exabytes com hardware commodity.
  • É padrão de facto em OpenStack e cresce rapidamente em Kubernetes via Rook — usado por CERN, DigitalOcean, Deutsche Telekom e milhares de operadores em produção.

Como funciona o Ceph?

Ceph é uma arquitetura de storage distribuído que agrega discos físicos em um único pool lógico, acessível por três interfaces simultaneamente.

Segundo Sage Weil no paper original (OSDI 2006), o Ceph foi projetado para eliminar gargalos de servidores de metadados centralizados comuns em sistemas distribuídos anteriores como Lustre e GPFS. Toda a plataforma roda sobre o RADOS (Reliable Autonomic Distributed Object Store), uma camada que fragmenta dados em objetos e os distribui pelos OSDs do cluster. Os Monitors mantêm o mapa consistente do cluster via Paxos, e o algoritmo CRUSH calcula de forma determinística em qual OSD cada objeto deve residir, sem consulta a um servidor central.

As 3 interfaces do Ceph

Ceph expõe três interfaces de acesso sobre o mesmo cluster RADOS, atendendo workloads distintos sem silos de infraestrutura.

  • RBD (RADOS Block Device): block storage que apresenta volumes como discos virtuais. Usado por hypervisors (KVM, Proxmox, OpenStack Nova) e Kubernetes para volumes persistentes de VMs e containers stateful.
  • RGW (RADOS Gateway): object storage com API compatível com Amazon S3 e OpenStack Swift. Ideal para backup, data lake, mídia estática e aplicações cloud-native que já falam S3.
  • CephFS: filesystem POSIX distribuído, montável como NFS tradicional. Usado para home directories, HPC, repositórios de código e workloads que exigem semântica de arquivos com locking.

Componentes essenciais

Um cluster Ceph de produção combina cinco tipos de daemons:

  • OSDs (Object Storage Daemons): um por disco físico. Armazenam dados, replicam, fazem rebalanceamento e recovery automático.
  • MONs (Monitors): mantêm consenso via Paxos sobre o estado do cluster. Mínimo recomendado: 3 (número ímpar para quórum).
  • MGRs (Managers): coletam métricas, hospedam dashboard web e expõem APIs de orquestração.
  • MDSs (Metadata Servers): necessários apenas para CephFS; gerenciam árvore de diretórios e locks de arquivo.
  • RGWs (RADOS Gateways): expõem a API S3/Swift para aplicações externas.

CRUSH Algorithm: coração do Ceph

CRUSH (Controlled Replication Under Scalable Hashing) é o algoritmo que decide onde cada objeto é armazenado sem consultar um servidor central de metadados.

Segundo o paper original de Sage Weil (OSDI 2006), o CRUSH usa um hash determinístico sobre o ID do objeto combinado com a topologia do cluster (data centers, racks, hosts, discos) para calcular a localização de forma reproduzível em qualquer nó. Isso elimina o single point of failure típico de servidores de metadados tradicionais e permite escalar linearmente. Segundo a Red Hat (2024), clusters Ceph em produção superam 10 bilhões de objetos sem degradação de performance, com placement calculado em microssegundos.

Ceph vs GlusterFS vs MinIO

Critério Ceph GlusterFS MinIO
Interfaces Block, Object, File File (NFS/SMB) Apenas Object (S3)
Escala máxima Exabytes Petabytes Petabytes
Maturidade Produção desde 2012 Suporte descontinuado pela Red Hat (2024) Produção desde 2016
Complexidade Alta Média Baixa
Caso ideal Cloud privada, OpenStack, K8s em escala Legado NAS S3 standalone, edge, dev

Exemplos práticos B2B

OpenStack cloud privada: operadora brasileira de telecom provisiona volumes Cinder para 2.000 VMs sobre cluster Ceph de 500 TB, substituindo SAN proprietária EMC com economia estimada de 60% em CAPEX e eliminando lock-in de fornecedor.

Kubernetes CSI com Rook: fintech roda 300 microsserviços stateful em Kubernetes com volumes persistentes RBD provisionados dinamicamente pelo operador Rook, incluindo snapshots automáticos e replicação cross-site para disaster recovery.

Backup S3-compatível on-premise: indústria substitui AWS S3 por bucket RGW on-premise para 80 TB de backups diários, atendendo compliance LGPD e exigências de dados em território nacional, com economia significativa em egress.

Ceph com OpenStack e Kubernetes

Segundo a OpenStack Foundation (2024), mais de 70% das instalações OpenStack em produção usam Ceph como backend de storage. A integração é nativa: Cinder (block) usa RBD para volumes de VMs, Glance (image service) armazena imagens no RGW, Nova (compute) booteia instâncias direto do Ceph, e Manila (file share) usa CephFS. No Kubernetes, o operador Rook (projeto graduado da CNCF em 2020) automatiza deploy e operação de clusters Ceph, enquanto o Ceph CSI driver provisiona volumes dinamicamente para pods stateful.

Replicação vs Erasure Coding

Ceph oferece duas estratégias de durabilidade de dados, cada uma com trade-offs distintos entre performance, custo e eficiência de storage.

  • Replicação 3x: cada objeto é copiado em três OSDs diferentes. Oferece melhor performance de leitura/escrita e recovery mais rápido, mas consome 300% de capacidade bruta — para 100 TB úteis, exige 300 TB de disco físico.
  • Erasure Coding (k+m): fragmenta objeto em k partes de dados e m de paridade. Configuração comum (4+2) usa apenas 150% de capacidade bruta, mas aumenta uso de CPU e latência de escrita. Ideal para dados frios como backup, arquivamento e mídia.

Quem usa Ceph

Segundo o CERN (2024), o laboratório opera um dos maiores clusters Ceph do mundo, com mais de 300 PB armazenando dados do LHC. A DigitalOcean sustenta seu serviço Spaces (object storage público) sobre Ceph. A Deutsche Telekom usa Ceph na Open Telekom Cloud. O Yahoo! migrou bilhões de fotos do Flickr para Ceph em 2015. Operadoras como Vodafone, China Mobile e Telefónica usam Ceph em infraestrutura NFV (Network Functions Virtualization) para 5G.

Erros comuns em Ceph

  1. Hardware subdimensionado: subestimar RAM dos OSDs (regra prática: 4 GB por TB de disco) causa OOM kills e cluster instável sob carga.
  2. Rede ruim: usar 1 GbE em cluster de produção gera bottleneck severo durante recovery. O mínimo é 10 GbE, idealmente com rede dedicada para replicação (cluster network separada da public network).
  3. Poucos Monitors: rodar com 1 MON é receita para desastre. Sempre usar 3 ou 5 (número ímpar para quórum Paxos tolerante a falhas).
  4. Erasure Coding em workload de alta IOPS: EC tem alto custo de CPU por escrita; usar em bancos de dados ou volumes de VM gera latência inaceitável. Reserve para dados frios.
  5. Sem monitoramento: Ceph requer observabilidade (Prometheus + Grafana + alertas) para detectar OSDs com problemas antes que afetem produção.

Como começar com Ceph — passo a passo

  1. Dimensione o cluster mínimo: 3 nós físicos com 4+ discos cada, 64 GB RAM por nó, 10 GbE dedicada.
  2. Instale o cephadm: ferramenta oficial de bootstrap desde a versão Octopus (2020), que roda daemons em containers Podman ou Docker.
  3. Execute o bootstrap: cephadm bootstrap --mon-ip <IP> cria o primeiro MON e MGR automaticamente.
  4. Adicione hosts: ceph orch host add node2 expande o cluster com novos nós.
  5. Crie OSDs: ceph orch apply osd --all-available-devices consome os discos livres de todos os hosts.
  6. Configure pools: crie pools RBD, RGW ou CephFS conforme o caso de uso, definindo replicação ou erasure coding.
  7. Monitore: acesse o dashboard web na porta 8443, integre com Prometheus e configure alertas no Alertmanager.

Ceph e a Shiftmind

A Shiftmind implementa soluções de storage corporativo e infraestrutura de alta disponibilidade há mais de 12 anos. Para projetos que exigem performance e controle total do dado, oferecemos servidor dedicado com especificações adequadas para clusters Ceph. Para operações web críticas, nossa hospedagem WordPress e serviço de suporte e manutenção WordPress garantem disponibilidade contínua. Também disponibilizamos segurança de websites e criação de sites WordPress sob medida para projetos corporativos.

Perguntas frequentes sobre Ceph

Ceph é gratuito?

Sim. Ceph é open-source sob licença LGPL, sem custos de licenciamento. Red Hat, SUSE e Canonical oferecem distribuições comerciais com suporte pago (Red Hat Ceph Storage, SUSE Enterprise Storage, Charmed Ceph). Para uso comunitário, o Ceph upstream é totalmente gratuito e pode ser instalado em qualquer hardware commodity x86. O investimento está em hardware, rede e expertise operacional.

Qual a diferença entre Ceph e Amazon S3?

Amazon S3 é um serviço gerenciado da AWS para object storage, cobrado por GB armazenado e requisições. Ceph é software que você instala em servidores próprios para construir um sistema de storage completo que inclui, entre outras interfaces, uma API S3-compatível via RGW. Com Ceph, você tem controle total do dado, sem lock-in de fornecedor, mas assume a responsabilidade operacional pelo cluster.

Ceph serve para pequenas empresas?

Não é a melhor escolha. Ceph exige mínimo 3 nós físicos, rede 10 GbE dedicada e expertise operacional significativa. Para pequenas empresas, soluções como MinIO (object standalone), TrueNAS Scale ou NAS tradicional (Synology, QNAP) são mais apropriadas. Ceph brilha a partir de 100 TB úteis, múltiplas interfaces simultâneas e requisitos de escala horizontal contínua.

Qual linguagem o Ceph usa?

Ceph é escrito majoritariamente em C++, com partes em Python (orquestração, cephadm, dashboard web) e componentes recentes em Rust (como o Crimson OSD, projetado para NVMe de ultra-baixa latência). O desenvolvimento ocorre no GitHub sob a Ceph Foundation, com releases nomeadas em ordem alfabética (Nautilus, Octopus, Pacific, Quincy, Reef, Squid).

Ceph substitui SAN e NAS corporativos?

Sim, para muitos casos. Ceph entrega block storage comparável a SAN (via RBD iSCSI gateway) e file storage comparável a NAS (via CephFS ou NFS Ganesha), com custo significativamente menor e escalabilidade superior. Segundo a Red Hat (2024), empresas que migraram de SAN proprietária para Ceph relatam economia de 50-70% em TCO ao longo de 5 anos.

Termos relacionados

Conclusão

Ceph é a plataforma de storage distribuído open-source mais madura e completa do mercado, dominando clouds privadas OpenStack e crescendo rapidamente em Kubernetes via Rook. Para operações que exigem escala petabyte, soberania de dados e múltiplas interfaces (block, object, file) em uma única plataforma, Ceph é referência técnica consolidada. A complexidade operacional é real, mas o retorno em flexibilidade e economia justifica o investimento.

Última atualização: Outubro/2026

Autor: Henry Douglas
Analista de marketing digital, trabalho com SEO desde 2010 e tenho 13 anos de experiência em em WordPress.

Como podemos te ajudar?

Entre em contato conosco hoje mesmo e descubra como nossa empresa de marketing pode impulsionar suas vendas, aumentar sua visibilidade online e alcançar seus objetivos de negócios.

Desenvolvemos projetos conforme as necessidades e objetivos de cada cliente, sempre com processos bem definidos e transparentes do planejamento ao controle, facilitando a comunicação com as partes interessadas e a melhoria contínua das ações de marketing implementadas.

Danilo Pedrosa
Especialista em Projetos de Marketing, Shiftmind