Il mercato in sintesi
Tutte le novità →I kit QuelLLM — il manuale di riferimento per uso.
Un kit per ogni uso: il manuale completo, le configurazioni pronte da incollare, lo spazio online a vita.
Il catalogo degli LLM open-weights
che girano localmente.
Tutti i modelli pertinenti, con VRAM richiesta per ciascuna quantizzazione, velocità stimata e casi d'uso. I modelli francesi sono evidenziati.
Trova il tuo LLM in base a le tue esigenze
Non vuoi passare per il configuratore? Le nostre classifiche tematiche selezionano i migliori modelli che puoi ospitare autonomamente, per caso d'uso e hardware.
La documentazione QuelLLM.
335+ Guide in italiano per Windows, macOS e Linux. I test eseguiti sono indicati in ogni guida. Dalla prima installazione alle tecniche avanzate di RAG e fine-tuning.
In evidenza
— le nostre guide essenzialiInstallare Ollama su Windows 11: guida completa (2026)
Scaricare Ollama per Windows 11, installarlo, abilitare la GPU (CUDA) e avviare un primo modello: la guida passo dopo passo 2026, con gli errori comuni.
Quale LLM usare su una RTX 4090 (24 GB)?
RTX 4090 24 GB, il riferimento per l'IA locale per il grande pubblico nel 2026. Qwen 3.8 27B, Devstral 24B, gpt-oss 20B, GLM 4.7 Flash, benchmark token/sec, ottimizzazioni CUDA Ada.
Quale LLM usare su una RTX 5090 (32 GB)?
RTX 5090 2025: 32 GB di VRAM GDDR7, banda passante 1792 GB/s. Far girare in locale i grandi MoE 2026 (Qwen 3.6 35B-A3B, Nemotron 3.5 Lightning) e Qwen 3.8 27B a contesto lungo, benchmark, configurazioni ideali.
DeepSeek V4 Pro in locale: VRAM, hardware, installazione
Quale macchina per DeepSeek V4 Pro (1.6T MoE, 49B attivi, MIT)? VRAM/RAM richieste, installazione locale, benchmark rispetto a GPT-5 e limiti reali.
LM Studio per principianti: prima chat locale in 10 minuti
Il tuo primo LLM locale con LM Studio: installazione, download di un modello e chat in 10 minuti. Zero righe di comando, ideale per principianti.
Quale LLM su RTX 3060 12 GB?
RTX 3060 12 GB: l'iconica GPU economica per gli LLM. 12 GB per 250 € sul mercato dell'usato, Gemma 4 12B, Qwen 3.5 9B, Granite 4.2 8B, benchmark dettagliati.
DeepSeek V4 Flash 284B: il primo frontier che gira su Mac Studio
DeepSeek V4 Flash 284B MoE (13B attivi, MIT, 1M ctx): il primo modello di frontiera eseguibile su workstation. Installazione su Mac Studio Ultra, benchmark, confronto con Pro.
Installare Ollama su macOS (Apple Silicon): guida 2026
Sfruttare Metal e la memoria unificata M1/M2/M3/M4.
Quale LLM su Mac mini M4 / M4 Pro (16–64 GB)?
Mac mini M4: il miglior rapporto prestazioni/prezzo per l'IA locale nel 2026. Benchmark, configurazione consigliata, uso come server domestico.
Quale LLM usare su una RTX 3090 / 3090 Ti (24 GB)?
RTX 3090 e 3090 Ti 24 GB usate: ancora eccellenti per gli LLM nel 2026. Qwen 3.8 27B, Qwen3-Coder 30B, benchmark, verdetto sul rapporto prestazioni/prezzo, raffreddamento.
Quale LLM per 12 GB di VRAM?
12 GB VRAM (RTX 3060 12GB, 4070, 5070): sweet spot 2026. Qwen 3.5 9B in Q8, Gemma 4 12B, RAG multi-stage. La guida definitiva.
Qwen 3.8 27B in locale: installazione Ollama e VRAM
Eseguire Qwen3.8-27B in locale: comando Ollama esatto, VRAM per quantizzazione, variante MLX su Mac, trappola del contesto 256k, modalità thinking e benchmark ufficiali.
La tua prima conversazione locale
Avviare Ollama, caricare Mistral, dialogare. Il tutorial del giorno 1.
Quale LLM usare su una RTX 5070 Ti (16 GB)?
RTX 5070 Ti 16 GB: il punto di equilibrio 2025 per l'IA locale. Benchmark Ollama, modelli 14B/24B eseguibili senza difficoltà, confronto con 4070 Ti Super.
Quale LLM su MacBook Pro M4 Pro / Max (24–128 GB)?
MacBook Pro M4 Pro / Max 2025: banda passante 546 GB/s, quali modelli sfruttano davvero il chip, quali sono i limiti pratici.
Quale LLM usare su una RTX 4070 / 4070 Super / 4070 Ti (12 GB)?
RTX 4070, 4070 Super e 4070 Ti 12 GB: confronto LLM, modelli 13B eseguibili senza difficoltà, limiti dei 12 GB, benchmark misurati.
Ollama vs LM Studio vs Jan vs GPT4All
Tabella riepilogativa per scegliere lo strumento adatto al tuo profilo.
Quale LLM usare con 8 GB di VRAM?
La guida completa per 8 GB di VRAM (RTX 3050/3060 8GB, 4060, 5050, 5060): Qwen 3.5 9B, Granite 4.2 8B, trucchi per sfruttare al meglio la VRAM.
IA per il codice in azienda: proteggere il codice proprietario, NDA e segreto industriale
Distribuire un'IA per la programmazione 100% locale (Ollama + Cline + Aider + Tabby) per un team di sviluppo vincolato da NDA e segreto industriale: perché Copilot e Cursor espongono il tuo codice proprietario, cosa richiedono il GDPR e l'AI Act, l'architettura su postazione rispetto a quella su server GPU Tabby e l'audit per verificare l'assenza di esfiltrazione.
Installare Ollama in 5 minuti (Windows, macOS, Linux)
Come installare Ollama in 5 minuti su Windows, macOS e Linux: requisiti di RAM/GPU, comandi essenziali e primo modello locale da avviare subito dopo.
Le basi del prompting
Strutturare le richieste per ottenere risposte utili.
Quale LLM su MacBook Pro M3 Pro / Max (18–128 GB)?
MacBook Pro M3 Pro / Max: il miglior laptop per l'IA locale nel 2026. Qwen 3.6 35B-A3B, contesto 128k, Flash Attention.
Quale LLM usare su una RTX 5080 (16 GB)?
RTX 5080 Blackwell: 16 GB GDDR7 a 960 GB/s. Benchmark Qwen 3.5, Granite 4.2, Gemma 4, gpt-oss, Devstral in Q4. Configurazione Ollama ottimale.
Quale LLM usare con 16 GB di VRAM?
16 GB VRAM (RTX 4070 Ti Super, 5070 Ti, 5080, 4060 Ti 16GB): Mistral Small 24B, Devstral 24B, gpt-oss 20B, il livello pro 2026.
Quale GPU per un LLM locale? Dalla RTX 4070 alla 5090, Mac (2026)
RTX 4070 vs 4090 vs Mac M-Max: guida all'acquisto 2026.
RAG locale: introduzione
Comprendere il Retrieval-Augmented Generation per chattare con i propri documenti.
Quale LLM usare su Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)?
Mac Studio Ultra: fino a 512 GB di memoria unificata. Far girare Llama 4 Maverick 402B, Qwen3-235B, DeepSeek 671B in locale. La guida per power user.
Quale LLM su RTX 4080 / 4080 Super (16 GB)?
RTX 4080 e 4080 Super 16 GB per gli LLM locali: tutti i modelli che ci stanno, benchmark, confronto 4080 vs 4080 Super, verdetto d'acquisto.
Quale LLM usare su una Radeon RX 7900 XTX (24 GB)?
Radeon RX 7900 XTX 24 GB: alternativa AMD alla RTX 4090 per LLM. ROCm 6.x, Qwen 3.8 27B, benchmark token/sec, verdetto 2026.
Quale LLM per 24 GB di VRAM?
24 GB di VRAM (RTX 3090, 4090, RX 7900 XTX): Qwen 3.8 27B interamente in VRAM, MoE di grandi dimensioni 35B-A3B, fine-tuning LoRA. La fascia per un uso serio.
Recensioni e test di strumenti IA.
Quando l'IA locale non basta, quali servizi online meritano i tuoi soldi? 14 marchi analizzati, 7 esclusi. Ogni scheda cita prima l'alternativa locale gratuita.
Tre percorsi,
a seconda di chi sei.
Ogni percorso è una sequenza di guide pensata per un profilo preciso. Dal primo download fino a una configurazione operativa.
« Voglio solo provare, senza problemi. »
Hai sentito parlare dei LLM locali e vuoi vedere come funzionano sul tuo dispositivo. Nessun codice, nessuna configurazione del sistema — in 10 minuti chatti con il tuo primo modello.