7 repositórios open source que valem o clone
Olá meus Unicórnios! 🦄✨
Sabe aquela aba do navegador com o repositório que "depois eu vejo"? 😅 Pois é, eu tinha sete. Sete abas abertas há dias, cada uma com um projeto open source que parecia resolver um problema que eu pagaria para resolver.
Resolvi fechar todas do jeito certo: lendo o README de cada um até o fim, onde mora a parte que ninguém coloca no título. Porque todo projeto desses tem uma frase escondida lá embaixo que muda a decisão: a chave paga, o segredo padrão que ninguém troca, o pacote que o pip não instala.
Então esta lista não é "os sete melhores do GitHub". É para que cada um serve, para quem, como subir o mínimo e qual é a pegadinha. As estrelas são de setembro de 2026 e mudam toda semana, então leia como ordem de grandeza.
Se você chegou aqui procurando mais ferramentas, eu já tinha feito uma lista irmã desta, com outros dez repositórios:
10 ferramentas open source para quem faz web Listas curadas, APIs gratuitas, IA local e agentes de código blog.palomamacetko.com.br🧰 O ritual que se repete em quase todos
Seis dos sete projetos sobem do mesmo jeito, com Docker. Em vez de explicar isso sete vezes, explico uma. Você vai precisar do Git (para baixar o código) e do Docker (no Windows e no Mac, o Docker Desktop, que precisa estar aberto antes de rodar qualquer comando).
git clone https://github.com/dono/projeto.git
cd projeto
cp .env.example .env
nano .env
docker compose up -d
Linha por linha: o git clone baixa o projeto para uma pasta nova; o cd entra nela; o cp copia o arquivo de exemplo de configuração para o .env de verdade (no Prompt de Comando do Windows, o comando é copy em vez de cp); o nano abre esse arquivo para você preencher; e o docker compose up -d sobe tudo em segundo plano.
Três coisas que travam quem está começando:
- O
.envsome dols. Arquivo cujo nome começa com ponto é oculto no Linux e no Mac. Ele está lá: usels -lapara ver. - Para colar no terminal,
Ctrl+Vnão funciona. UseCtrl+Shift+Vou o botão direito do mouse. - Para salvar no
nano:Ctrl+O,Enterpara confirmar o nome, eCtrl+Xpara sair. O^que aparece no rodapé dele quer dizerCtrl.
Agora sim, os sete. 🚀
🤝 CRM da Comp AI: o CRM onde quem trabalha é o agente
A proposta é inverter o CRM. Em vez de um banco de dados com um formulário na frente (e, nos "com IA", uma caixinha de chat do lado), aqui um agente roda sozinho, com fila e agenda próprias: pesquisa os contatos, preenche as fichas, marca quando vai olhar de novo e para quando o orçamento de pesquisa acaba. Você fecha o navegador e ele continua.
A regra que mais me chamou a atenção está logo no começo do README: nada sobre uma pessoa é chutado. As ferramentas do agente não aceitam "grau de confiança", porque, nas palavras deles, um modelo convidado a avaliar a própria certeza vai errar sempre para o lado que o faz parecer útil. Evidência forte vai para a ficha; evidência fraca vira sugestão para um humano decidir. E ele funciona sem nenhuma chave de API, lendo só os seus e-mails, reuniões e assinaturas.
Para quem: time pequeno de vendas que quer um CRM próprio, e dev curioso para ver um agente de longa duração feito do jeito certo. É TypeScript (Next.js, NestJS, Prisma e Postgres), licença MIT, cerca de 10 mil estrelas.
git clone https://github.com/trycompai/crm.git && cd crm
cp .env.example .env
bun install
docker compose up -d
bun run db:deploy
bun run dev
Ele usa o Bun (um substituto do Node) além do Docker. O bun install baixa as dependências, o docker compose sobe só o Postgres, o db:deploy cria as tabelas e o dev abre o app em localhost:3000.
📈 open-seo: o Semrush que você paga por consulta
O open-seo se apresenta como alternativa open source ao Semrush e ao Ahrefs. Tem pesquisa de palavras-chave, acompanhamento de posição no Google, análise de concorrentes, backlinks, auditoria do site e "visibilidade em IA". E expõe um servidor MCP, então o seu agente de código consegue consultar os dados de SEO direto.
O que me fez parar foi o modelo de custo, que é honesto e está escrito no README: não tem assinatura. Os dados vêm da DataForSEO, você coloca a sua chave e paga só o que consultar. Se preferir não hospedar, a versão deles custa US$ 10 por mês e cobra 28% a mais sobre cada consulta à DataForSEO. É assim que eles se sustentam, e acho ótimo que digam.
Para quem: quem cuida do SEO de poucos sites e não justifica uma assinatura de ferramenta grande. TypeScript, MIT, cerca de 20 mil estrelas.
git clone https://github.com/every-app/open-seo.git && cd open-seo
cp .env.example .env
nano .env
docker compose up -d
No nano, preencha a linha DATAFORSEO_API_KEY. Depois abra localhost:3001; a primeira subida demora um ou dois minutos.
🔔 changedetection.io: o sino que toca quando o site muda
Você cadastra uma página e ele avisa quando ela muda. Parece pouco até você listar os usos: o preço que caiu, o produto que voltou ao estoque, a página de vagas de uma empresa, o edital no site da prefeitura, o PDF de termos de uso que mudou uma vírgula, a resposta de uma API JSON. O aviso vai por e-mail, Telegram, Discord, Slack, webhook e mais uma lista enorme (ele usa a biblioteca Apprise por baixo).
O que eu mais gosto é poder filtrar o pedaço que importa, com seletor CSS, XPath ou jq, para não ser acordada porque mudou o rodapé. Também dá para agendar a checagem só em horário comercial.
Para quem: qualquer pessoa, de dev a quem está caçando promoção. É um dos veteranos da lista, no GitHub desde 2021: Python, licença Apache 2.0, cerca de 34 mil estrelas.
docker run -d --restart always -p "127.0.0.1:5000:5000" -v datastore-volume:/datastore --name changedetection.io dgtlmoon/changedetection.io
Uma linha só: baixa a imagem, sobe o contêiner, reinicia sozinho se a máquina reiniciar, guarda os dados num volume e abre em http://127.0.0.1:5000. Repare no 127.0.0.1 antes da porta: ele faz o painel responder só na própria máquina. Se você está numa VPS e o painel "não abre", é isso, e é proposital. Não troque por 0.0.0.0 sem pensar em quem mais vai enxergar o painel.
🪞 ai-website-cloner-template: o agente que refaz um site em Next.js
Este é diferente: não é um programa, é um modelo de projeto para o seu agente de código. Você abre a pasta no Claude Code, no Codex, no Cursor ou no OpenCode, digita /clone-website com uma URL, e o agente refaz aquele site como um app Next.js limpo.
O processo descrito no README é bem pensado: primeiro ele tira capturas e extrai cores, fontes e espaçamentos; depois escreve uma especificação por componente, com os valores de CSS calculados de verdade; aí vários agentes constroem as seções em paralelo; e no fim ele compara a cópia com o original, visualmente.
Para quem: quem precisa tirar o próprio site do WordPress, do Webflow ou do Squarespace, quem perdeu o código-fonte de um site que ainda está no ar, e quem quer estudar como um layout foi feito. TypeScript, MIT, cerca de 35 mil estrelas. Precisa do Node 24 ou mais novo e de um agente com acesso ao navegador.
git clone https://github.com/JCodesMore/ai-website-cloner-template.git meu-clone
cd meu-clone
npm install
npm run check
O npm install baixa as dependências e o npm run check confere se está tudo de pé (lint, tipos e build). Depois disso, dentro do agente, é só pedir:
/clone-website https://seusite.com.br
🕷️ Scrapling: raspagem sem escrever código
O Scrapling já apareceu na lista anterior, onde eu falei dos seletores que se readaptam quando o site muda de layout. Ele volta aqui por outro motivo: dá para usar direto do terminal, sem escrever uma linha de Python. E vale a atenção pelo tamanho: cerca de 83 mil estrelas, Python, licença BSD-3-Clause.
Só que a instalação tem uma pegadinha que pega todo mundo. O comando óbvio instala só o analisador de HTML:
pip install scrapling
E aí, no primeiro from scrapling.fetchers import Fetcher, a última linha do erro é esta:
ModuleNotFoundError: No module named 'curl_cffi'
O README avisa, num quadro "IMPORTANT" que ninguém lê: quem busca as páginas (os fetchers) vem num extra. E tem um segundo degrau: salvar o resultado em Markdown pede outro extra, o rag, senão ele recusa com Markdown conversion requires the "markdownify" package. Para texto puro, basta o primeiro:
pip install "scrapling[fetchers]"
scrapling extract get "https://quotes.toscrape.com/" citacoes.txt --css-selector ".quote .text"
O extract get baixa a página, o --css-selector escolhe o que guardar (aqui, o texto de cada citação) e o final .txt diz o formato. A saída real (encurtei o caminho da pasta e tirei a data e a hora do começo de cada linha):
INFO: Fetched (200) <GET https://quotes.toscrape.com/> (referer: https://www.google.com/)
INFO: Content successfully saved to 'citacoes.txt'
Repare em dois detalhes que o terminal entrega sozinho. Primeiro, o referer: https://www.google.com/: por padrão, o Scrapling diz ao site que você chegou de uma busca no Google. É parte do disfarce, e é bom você saber que ele está fazendo isso em seu nome. Segundo, o arquivo saiu com as dez citações grudadas numa linha só, sem quebra entre elas. O começo dele:
“The world as we have created it is a process of our thinking. It cannot be changed without changing our thinking.”“It is our choices, Harry, that show what we truly are, far more than our abilities.”
Para uma lista, o .txt não serve: use .md (com o extra rag) ou escreva o script em Python.
📄 PaddleOCR: o PDF escaneado virando dado
O PaddleOCR lê texto de imagem e de PDF, e vai além do OCR clássico: transforma documento bagunçado (tabela, fórmula, carimbo, gráfico) em Markdown ou JSON prontos para alimentar uma IA. Reconhece mais de 100 idiomas, português incluído (é o código pt na lista de idiomas da documentação). É o maior da lista: cerca de 90 mil estrelas, Python, licença Apache 2.0, e aparece integrado em ferramentas como Dify e RAGFlow.
Para quem: quem tem pilha de nota fiscal, contrato ou formulário escaneado e quer extrair os dados sem digitar, e quem monta RAG com documento que não é texto puro.
A pegadinha está na documentação de instalação, não no README: o pip install paddleocr não traz o motor que roda os modelos. O PaddlePaddle se instala à parte, e a versão muda se você tem placa de vídeo ou não. Para rodar só no processador:
python -m pip install paddlepaddle==3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/cpu/
python -m pip install paddleocr
paddleocr ocr -i nota.png --save_path ./saida
A primeira linha instala o motor para CPU (o -i aponta para o repositório de pacotes do próprio PaddlePaddle, porque ele não vem do lugar padrão do pip); a segunda, o PaddleOCR; a terceira lê a imagem nota.png e guarda o resultado na pasta saida. Para GPU, a documentação traz um comando por versão do CUDA.
🕸️ flowsint: investigação em grafo
OSINT é investigação com fontes abertas: juntar o que é público sobre um domínio, um IP, uma empresa ou um e-mail até formar um quadro. O flowsint faz isso num grafo visual: você coloca um domínio na tela e vai "enriquecendo" (DNS, WHOIS, subdomínios, ASN, rastreadores do site, vazamentos de dados) e cada resultado vira um nó ligado ao anterior.
Para quem: analistas de segurança, quem investiga fraude e jornalistas. Para dev, é ótimo para auditar a própria infraestrutura: ver tudo o que está exposto a partir do seu domínio. TypeScript e Python, cerca de 9 mil estrelas. Um detalhe de licença: o projeto era AGPL-3.0 e passou para Apache 2.0 em 25 de janeiro de 2026, com a concordância de todos os contribuidores.
git clone https://github.com/reconurge/flowsint.git
cd flowsint
make prod
No Linux e no Mac, o make prod faz tudo. No Windows não precisa de make: depois do git clone, o README manda copiar o .env.example para quatro lugares (a raiz e as pastas flowsint-api, flowsint-core e flowsint-app) e rodar docker compose -f docker-compose.prod.yml up -d. Aí é abrir http://localhost:5173/register e criar a sua conta, porque não existe usuário padrão. Tudo fica guardado na sua máquina.
E a pegadinha que importa mais: o projeto tem um ETHICS.md que proíbe vigilância e coleta não autorizadas, assédio, doxxing e chantagem. Dado público não é dado liberado: informação pessoal continua protegida pela LGPD mesmo quando alguém a deixou à vista. Investigue a sua infraestrutura e o que você tem autorização para investigar.
Fechei as sete abas. 🥹 O README de verdade começa onde termina a propaganda: é lá embaixo que moram a chave paga, o login que não existe e o pip install que instala pela metade.
Por hoje é só, meus unicórnios! 🦄✨
Que a magia do arco-íris continue brilhando em suas vidas! Até mais! 🌈🌟
Perguntas frequentes
O open-seo é mesmo de graça?
Por que o Scrapling dá ModuleNotFoundError logo depois do pip install?
pip install scrapling instala só o analisador de HTML. Os fetchers (quem baixa a página) ficam num extra: sem ele, importar scrapling.fetchers quebra com No module named 'curl_cffi'. Instale com pip install "scrapling[fetchers]", e para salvar em Markdown ainda falta o extra rag.Instalei o PaddleOCR com pip e ele não roda. O que falta?
pip install paddleocr não traz o PaddlePaddle, que se instala à parte (versão para CPU ou para GPU, cada uma com seu índice de pacotes). E confira o Python: o selo do projeto indica de 3.8 a 3.12.É legal clonar um site com o ai-website-cloner-template?
O flowsint é seguro para expor na rede da empresa?
.env (AUTH_SECRET, MASTER_VAULT_KEY_V1 e NEO4J_PASSWORD), que vêm com valores públicos no .env.example, e de liberar o nome do servidor no nginx.conf. Para rede aberta, o README recomenda ainda um proxy com HTTPS na frente da porta 5173.O changedetection.io funciona em site feito em React?
sockpuppetbrowser (um Chrome de verdade) no docker-compose.yml.Leia também
OpenSEO: instalando na VPS e auditando um site
Como instalar o OpenSEO, alternativa aberta ao Semrush, numa VPS com Docker, auditar um site de verdade e entender a chave da DataForSEO.
changedetection.io: vigiando mudanças em sites na sua VPS
Instale o changedetection.io numa VPS com Docker, vigie um site com filtro CSS, receba o aviso no celular e acabe com o alarme falso do RSS.
Project NOMAD: seu servidor offline de emergência
Instale o Project NOMAD numa VPS Ubuntu e tenha Wikipédia, mapas, cursos e IA funcionando sem nenhuma conexão com a internet.