DeskLLM - Guia

Converse com modelos de IA executando inteiramente no seu desktop. Sem necessidade de internet, sem que os dados saiam do seu dispositivo.


Primeiros Passos

1. Baixe um Modelo

O DeskLLM precisa de um modelo de linguagem para funcionar. Na primeira execução, clique no ícone de download na barra de ferramentas inferior para abrir o Model Manager.

Recommend tab — Escolha um modelo que se ajuste ao seu computador:

CategoriaRAMIndicado para
Ultra Light4 GB+Respostas rápidas, recursos mínimos
Light8 GB+Tarefas do dia a dia, assistente em segundo plano
Standard16 GB+Chat, escrita, resumo
High-End32 GB+Raciocínio complexo, geração de código

Clique em Download em qualquer cartão de modelo. O progresso do download é mostrado em tempo real.

Browse tab — Pesquise no Hugging Face qualquer modelo GGUF por palavra-chave.

2. Comece a Conversar

  1. Selecione um modelo no menu suspenso da barra inferior
  2. Clique no ícone de carregamento (o modelo é carregado automaticamente na primeira mensagem se não estiver carregado)
  3. Digite sua mensagem e pressione Return para enviar
  4. A IA responde em tempo real, token por token

Visão Geral da Interface

Barra Lateral

Alterne com o ícone de hambúrguer (canto superior esquerdo). Mostra suas sessões de chat.

  • Clique em uma sessão para alternar para ela
  • Clique com o botão direito para Rename ou Delete
  • Clique em + New Chat para iniciar uma nova conversa

Área de Chat

  • Suas mensagens aparecem à direita (balões coloridos)
  • Respostas da IA aparecem à esquerda
  • Clique no ícone de copiar em qualquer mensagem para copiá-la para a área de transferência
  • Pressione Shift + Return para uma nova linha sem enviar

Barra de Ferramentas Inferior

ElementoDescrição
Menu de modelosSelecione qual modelo usar
Ícone de downloadAbre o Model Manager
Ícone de carregar / descarregarCarregue ou descarregue manualmente o modelo atual
Rótulo de statusMostra “Generating…” durante a resposta

Gerenciamento de Modelos

Abra com o ícone de download na barra de ferramentas.

  • Downloaded tab — Lista todos os modelos no seu disco. Exclua modelos que você não precisa mais para liberar espaço.
  • Recommend tab — Lista curada de modelos populares com download de um clique. O espaço em disco é mostrado antes do download.
  • Browse tab — Pesquise diretamente no Hugging Face. Filtre por nome e navegue pelos arquivos GGUF disponíveis para qualquer repositório.

Onde os Modelos são Armazenados

OSCaminho
macOS~/Library/Application Support/DeskAssist/llm_models/
Windows%APPDATA%/DeskAssist/llm_models/

Configurações

Acesse pelo ícone de engrenagem (canto inferior esquerdo) ou pelo menu da aplicação.

ConfiguraçãoDescriçãoPadrão
TemperatureNível de criatividade (0.0 = focado, 1.0+ = criativo)0.7
Max TokensComprimento máximo da resposta512
Context SizeQuanto histórico de conversa o modelo enxerga2048
System PromptInstruções dadas ao modelo antes de cada conversa“You are a helpful assistant.”
API EnabledInicia um servidor REST API localOn
API PortNúmero da porta do servidor API8800

Escolhendo as Configurações Certas

  • Temperature — Mais baixo (0.1–0.3) para respostas factuais. Mais alto (0.7–1.0) para escrita criativa.
  • Max Tokens — Aumente para respostas mais longas. 512 é bom para a maioria das conversas.
  • Context Size — Valores maiores permitem que o modelo lembre mais da conversa, mas usam mais RAM.

REST API

O DeskLLM executa um servidor API local compatível com o formato OpenAI. Outras aplicações no seu computador podem usá-lo.

Endpoint: http://localhost:8800

Exemplo (curl)

curl http://localhost:8800/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Hello!"}],
    "stream": true
  }'

Exemplo (Python)

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8800/v1", api_key="none")
response = client.chat.completions.create(
    model="local",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

Atalhos de Teclado

AçãomacOSWindows
Mostrar / Ocultar janelaCtrl + Cmd + F8Ctrl + Alt + F8
Enviar mensagemReturnReturn
Nova linhaShift + ReturnShift + Return
Novo chatCmd + NCtrl + N

Dicas

  • Troque de modelos livremente — Você pode mudar de modelo no meio de uma conversa a qualquer momento.
  • System prompt — Personalize-o para diferentes casos de uso: tradutor, assistente de programação, ajudante de escrita, etc.
  • Múltiplas sessões — Mantenha conversas separadas para diferentes tópicos. A barra lateral facilita a troca.
  • Uso offline — Uma vez que um modelo é baixado, o DeskLLM funciona completamente offline.
  • Integração com API — Use a API integrada para conectar o DeskLLM com outras ferramentas, scripts ou aplicações na sua máquina.

Solução de Problemas

ProblemaSolução
Modelo não carregaVerifique a RAM disponível. Quantização menor (Q4_K_M) usa menos memória.
Respostas lentasTente um modelo menor. Feche outros aplicativos que consomem muita memória.
Saída embaralhadaReduza a temperatura. Tente um modelo diferente.
Falha no downloadVerifique a conexão com a internet. Tente novamente — os downloads são retomados automaticamente.
App não iniciaExclua o arquivo de configurações e reinicie.

Privacidade

  • Todo o processamento de IA acontece localmente no seu computador
  • Nenhum dado é enviado a qualquer servidor externo
  • O histórico de chat é armazenado apenas no seu disco local
  • Os modelos são baixados do Hugging Face (o único acesso à rede)