Converse com modelos de IA executando inteiramente no seu desktop. Sem necessidade de internet, sem que os dados saiam do seu dispositivo.
Primeiros Passos
1. Baixe um Modelo
O DeskLLM precisa de um modelo de linguagem para funcionar. Na primeira execução, clique no ícone de download na barra de ferramentas inferior para abrir o Model Manager.
Recommend tab — Escolha um modelo que se ajuste ao seu computador:
| Categoria | RAM | Indicado para |
|---|---|---|
| Ultra Light | 4 GB+ | Respostas rápidas, recursos mínimos |
| Light | 8 GB+ | Tarefas do dia a dia, assistente em segundo plano |
| Standard | 16 GB+ | Chat, escrita, resumo |
| High-End | 32 GB+ | Raciocínio complexo, geração de código |
Clique em Download em qualquer cartão de modelo. O progresso do download é mostrado em tempo real.
Browse tab — Pesquise no Hugging Face qualquer modelo GGUF por palavra-chave.
2. Comece a Conversar
- Selecione um modelo no menu suspenso da barra inferior
- Clique no ícone de carregamento (o modelo é carregado automaticamente na primeira mensagem se não estiver carregado)
- Digite sua mensagem e pressione Return para enviar
- A IA responde em tempo real, token por token
Visão Geral da Interface
Barra Lateral
Alterne com o ícone de hambúrguer (canto superior esquerdo). Mostra suas sessões de chat.
- Clique em uma sessão para alternar para ela
- Clique com o botão direito para Rename ou Delete
- Clique em + New Chat para iniciar uma nova conversa
Área de Chat
- Suas mensagens aparecem à direita (balões coloridos)
- Respostas da IA aparecem à esquerda
- Clique no ícone de copiar em qualquer mensagem para copiá-la para a área de transferência
- Pressione Shift + Return para uma nova linha sem enviar
Barra de Ferramentas Inferior
| Elemento | Descrição |
|---|---|
| Menu de modelos | Selecione qual modelo usar |
| Ícone de download | Abre o Model Manager |
| Ícone de carregar / descarregar | Carregue ou descarregue manualmente o modelo atual |
| Rótulo de status | Mostra “Generating…” durante a resposta |
Gerenciamento de Modelos
Abra com o ícone de download na barra de ferramentas.
- Downloaded tab — Lista todos os modelos no seu disco. Exclua modelos que você não precisa mais para liberar espaço.
- Recommend tab — Lista curada de modelos populares com download de um clique. O espaço em disco é mostrado antes do download.
- Browse tab — Pesquise diretamente no Hugging Face. Filtre por nome e navegue pelos arquivos GGUF disponíveis para qualquer repositório.
Onde os Modelos são Armazenados
| OS | Caminho |
|---|---|
| macOS | ~/Library/Application Support/DeskAssist/llm_models/ |
| Windows | %APPDATA%/DeskAssist/llm_models/ |
Configurações
Acesse pelo ícone de engrenagem (canto inferior esquerdo) ou pelo menu da aplicação.
| Configuração | Descrição | Padrão |
|---|---|---|
| Temperature | Nível de criatividade (0.0 = focado, 1.0+ = criativo) | 0.7 |
| Max Tokens | Comprimento máximo da resposta | 512 |
| Context Size | Quanto histórico de conversa o modelo enxerga | 2048 |
| System Prompt | Instruções dadas ao modelo antes de cada conversa | “You are a helpful assistant.” |
| API Enabled | Inicia um servidor REST API local | On |
| API Port | Número da porta do servidor API | 8800 |
Escolhendo as Configurações Certas
- Temperature — Mais baixo (0.1–0.3) para respostas factuais. Mais alto (0.7–1.0) para escrita criativa.
- Max Tokens — Aumente para respostas mais longas. 512 é bom para a maioria das conversas.
- Context Size — Valores maiores permitem que o modelo lembre mais da conversa, mas usam mais RAM.
REST API
O DeskLLM executa um servidor API local compatível com o formato OpenAI. Outras aplicações no seu computador podem usá-lo.
Endpoint: http://localhost:8800
Exemplo (curl)
curl http://localhost:8800/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Hello!"}],
"stream": true
}'
Exemplo (Python)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8800/v1", api_key="none")
response = client.chat.completions.create(
model="local",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
Atalhos de Teclado
| Ação | macOS | Windows |
|---|---|---|
| Mostrar / Ocultar janela | Ctrl + Cmd + F8 | Ctrl + Alt + F8 |
| Enviar mensagem | Return | Return |
| Nova linha | Shift + Return | Shift + Return |
| Novo chat | Cmd + N | Ctrl + N |
Dicas
- Troque de modelos livremente — Você pode mudar de modelo no meio de uma conversa a qualquer momento.
- System prompt — Personalize-o para diferentes casos de uso: tradutor, assistente de programação, ajudante de escrita, etc.
- Múltiplas sessões — Mantenha conversas separadas para diferentes tópicos. A barra lateral facilita a troca.
- Uso offline — Uma vez que um modelo é baixado, o DeskLLM funciona completamente offline.
- Integração com API — Use a API integrada para conectar o DeskLLM com outras ferramentas, scripts ou aplicações na sua máquina.
Solução de Problemas
| Problema | Solução |
|---|---|
| Modelo não carrega | Verifique a RAM disponível. Quantização menor (Q4_K_M) usa menos memória. |
| Respostas lentas | Tente um modelo menor. Feche outros aplicativos que consomem muita memória. |
| Saída embaralhada | Reduza a temperatura. Tente um modelo diferente. |
| Falha no download | Verifique a conexão com a internet. Tente novamente — os downloads são retomados automaticamente. |
| App não inicia | Exclua o arquivo de configurações e reinicie. |
Privacidade
- Todo o processamento de IA acontece localmente no seu computador
- Nenhum dado é enviado a qualquer servidor externo
- O histórico de chat é armazenado apenas no seu disco local
- Os modelos são baixados do Hugging Face (o único acesso à rede)