¿Qué puedes hacer ya con tu ordenador?
Un asistente honesto: analiza lo que tu máquina y tu navegador permiten de verdad, traduce ese análisis a recomendaciones conservadoras por uso (programar, escribir, estudiar documentos, OCR) y te deja probar un chat con LLMs que de verdad responden directamente aquí, en tu equipo.
Prometidas al 100 % solo dos cosas: no se finge aceleración gráfica donde no la hay y los números que el navegador no expone (VRAM real, RAM exacta) se marcan como desconocidos o aproximados. La descarga de modelos no es opcional para chatear, y el offline total no está garantizado: los ficheros vienen de CDN y del Hub.
Paso 1 · Qué hay en tu máquina
El análisis es voluntario y se queda en tu navegador: pide un dispositivo GPU de prueba y lo destruye al terminar. Después puedes corregir o completar los datos a mano; el navegador no puede saberlo todo.
Paso 2 · Para qué lo quieres
Paso 3 · Qué te recomiendo, con criterio conservador
El criterio: peso en disco del cuantizado + margen de runtime y contexto frente a la RAM que una pestaña puede usar de verdad. Sin VRAM inventada: si no la declaras, no cuenta.
Catálogo curado verificado el 2026-09-05. ¿Qué se mueve ahora mismo? Consulta eltrending de models en Hugging Face (JSON), pero nada de eso se descarga automáticamente desde aquí.
Paso 4 · Llévate la configuración
Descarga un JSON con tu diagnóstico, tus respuestas y las recomendaciones, para replicarlas en tu máquina con las guías oficiales. Esta web no instala nada ni levanta servicios locales.
Guías oficiales para la vía nativa
Paso 5 · Pruébalo aquí mismo
La inferencia corre en tu equipo: Transformers.js 4.2.0 (versión fijada) dentro de un Worker, sobre WebGPU. Nada de lo que escribes sale de este navegador, salvo la descarga inicial del modelo desde Hugging Face. Y un límite honesto que hemos MEDIDO: los modelos de este catálogo (INT4 por bloques) NO crean sesión en WASM/CPU — a ONNX Runtime-WASM le falta el kernel GatherBlockQuantized. Si tu diagnóstico dice «WebGPU no disponible», aquí no hay demo posible por mucha RAM que tengas: eso es la vía nativa.
Modelo, dispositivo y perfil
La comprobación revisa la ficha en la API de Hugging Face (sin código propio), el config.json en una REVISIÓN FIJA, que exista el fichero exacto onnx/model_q4.onnx (el que descarga dtype «q4») con sus pesos externos onnx/model_q4.onnx_data*, el tokenizer y la plantilla de chat, y mide el peso real de TODO eso junto. Un ONNX suelto no basta: si falta algo de eso, se rechaza y se dice por qué. La descarga usa exactamente la revisión validada.
Contexto enviado: se mide en TOKENES con un presupuesto conservador (~1.400 tokens, descontando la respuesta pedida y la plantilla de chat). La pregunta y el prompt de sistema se preservan; el historial entra de atrás adelante y el documento ocupa solo el espacio restante. El worker repite el cálculo con el tokenizador real del modelo y avisa si recorta algo. El historial COMPLETO se guarda siempre: recortar el contexto no borra ni un mensaje.
Límites honestos: hasta 500 mensajes por conversación y 100 conversaciones, con un presupuesto global de historial (4 millones de caracteres y 9 MB de JSON exportado). Al llegar al límite se avisa y se impide el siguiente turno; aquí no se borra nada a escondidas, así que un export siempre se puede volver a importar.
Fuentes y límites de esta guía
- Los tamaños de los modelos son el peso REAL medido en la API de Hugging Face (api/models/…/tree) el 2026-09-05: onnx/model_q4.onnx (el fichero que descarga Transformers.js con dtype «q4») MÁS sus ficheros de pesos externos onnx/model_q4.onnx_data*, que es donde vive el peso de verdad en los repos modernos — el .onnx suelto son solo cientos de KB de grafo. model_quantized.onnx NO es el q4: en estos repos es el int8. La RAM necesaria es una estimación (peso × 1,6 + margen): trátala como orden de magnitud.
- El catálogo navegador es pequeño a propósito: solo hay modelos que en el navegador mantienen una conversación útil — Qwen3.5-0,8B solo texto (~0,57 GB), LFM2.5-2,6B (~1,87 GB) y el Ling-3.0-tiny MoE (~4,85 GB, solo WebGPU, para ver el techo). Se fuera SmolLM2-135M y los Qwen2.5 de 2024: no daban la talla.
- No todos los modelos publican el mismo cuantizado: el Ling-3.0-tiny SOLO tiene onnx/model_q4f16.onnx (INT4 con runtime y caché FP16). Esta web manda el dtype que declara cada ficha; forzarle un q4 a ese repo sería un 404. Y q4f16 no es un Q4_K_M de GGUF: no son comparables.
- Lo de «WebGPU o, si no, WASM (CPU)» ya NO es cierto con este catálogo: comprobado con descarga real, el q4 y el q4f16 del Qwen3.5-0,8B terminan de bajar y luego fallan al crear la sesión en CPU («Could not find an implementation for GatherBlockQuantized»). Así que la web ya no te deja ir: si eliges WASM para un modelo declarado solo-WebGPU, para ANTES de descargar un byte y te lo dice (y el worker comprueba el adaptador GPU antes de bajar nada). Si tienes WebGPU, el dispositivo se pone solo en WebGPU al entrar en el paso 5.
- La VRAM no la expone ningún navegador: cuando aparece, la ha escrito una persona. WebGPU se comprueba pidiendo un dispositivo de prueba y destruyéndolo; si está desactivado o ausente, se dice y se usa CPU.
- Los modelos «nativos» (la familia Qwen3.5: 0,8B · 2B · 4B · 9B · 27B, y PaddleOCR-VL-1.6) son guías con enlaces oficiales: esta web no los ejecuta, no instala nada y no levanta servicios locales. Los Gigabytes citados son el fichero GGUF Q4_K_M medido en el repo, no el consumo total.
- El offline total no está garantizado: la librería, el visor de PDF y los modelos vienen de CDN con versión fijada. Descargados una vez, el chat funciona sin conexión… hasta que el navegador decida limpiar la caché.
Fichas de modelo citadas:Qwen3.5-0.8B (texto, ONNX) · LFM2.5-2.6B-Uncensored (ONNX) · Ling-3.0-tiny (ONNX) · Ling-3.0-tiny (base) · Qwen3.5-0.8B GGUF · Qwen3.5-2B GGUF · Qwen3.5-4B GGUF · Qwen3.5-9B GGUF · Qwen3.5-27B GGUF · PaddleOCR-VL-1.6 · Transformers.js