---
title: "RAG sem OpenAI: como a NTLabs faz busca semântica 100% local"
description: "Na NTLabs, implementamos RAG sem OpenAI — 100% local com Sentence Transformers e Cross-Encoder. Custo zero, privacidade total."
author: "Anderson Henrique"
date: "2026-04-07T11:04:51.281671Z"
updated: "2026-04-08T14:20:28.255862Z"
category: "bit-by-bit"
tags: ["rag","ia","local-first","embeddings"]
canonical: "https://www.ntlabs.dev/blog/bit-rag-local-sem-openai"
locale: "pt"
---

Quando a maioria das empresas implementa RAG (Retrieval-Augmented Generation), o primeiro reflexo é plugar na API da OpenAI. Embeddings do Ada, completions do GPT-4 — funciona, mas custa.

Na NTLabs, escolhemos um caminho diferente: **RAG 100% local**, sem nenhuma dependência de APIs externas para embeddings ou reranking.

## Como funciona

Usamos **Sentence Transformers** para gerar embeddings localmente e **Cross-Encoder** para reranking. O modelo roda no próprio servidor da API, sem chamadas externas.

O pipeline:
1. Documentos são chunked e indexados com embeddings locais
2. Query do usuário é transformada em embedding
3. Busca por similaridade coseno retorna top-K candidatos
4. Cross-Encoder reordena por relevância semântica
5. Contexto vai para o LLM gerar a resposta

## Por que local?

- **Custo zero** em embeddings (OpenAI cobra por token)
- **Privacidade**: dados nunca saem do servidor
- **Latência previsível**: sem dependência de API externa
- **Offline-capable**: funciona sem internet

O trade-off? Modelos locais são menores que os da OpenAI. Mas com Cross-Encoder para reranking, a qualidade final é surpreendentemente boa.

**Bottom line**: antes de assinar mais uma API, pergunte se você realmente precisa dela. Às vezes, a solução mais simples é a mais inteligente.
