¿Qué puedes hacer ya con tu ordenador?

Un asistente honesto: analiza lo que tu máquina y tu navegador permiten de verdad, traduce ese análisis a recomendaciones conservadoras por uso (programar, escribir, estudiar documentos, OCR) y te deja probar un chat con LLMs que de verdad responden directamente aquí, en tu equipo.

Prometidas al 100 % solo dos cosas: no se finge aceleración gráfica donde no la hay y los números que el navegador no expone (VRAM real, RAM exacta) se marcan como desconocidos o aproximados. La descarga de modelos no es opcional para chatear, y el offline total no está garantizado: los ficheros vienen de CDN y del Hub.

Paso 1 · Qué hay en tu máquina

El análisis es voluntario y se queda en tu navegador: pide un dispositivo GPU de prueba y lo destruye al terminar. Después puedes corregir o completar los datos a mano; el navegador no puede saberlo todo.

Datos que solo tú sabes (opcionales pero ayudan)

Fuentes y límites de esta guía

  • Los tamaños de los modelos son el peso REAL medido en la API de Hugging Face (api/models/…/tree) el 2026-09-05: onnx/model_q4.onnx (el fichero que descarga Transformers.js con dtype «q4») MÁS sus ficheros de pesos externos onnx/model_q4.onnx_data*, que es donde vive el peso de verdad en los repos modernos — el .onnx suelto son solo cientos de KB de grafo. model_quantized.onnx NO es el q4: en estos repos es el int8. La RAM necesaria es una estimación (peso × 1,6 + margen): trátala como orden de magnitud.
  • El catálogo navegador es pequeño a propósito: solo hay modelos que en el navegador mantienen una conversación útil — Qwen3.5-0,8B solo texto (~0,57 GB), LFM2.5-2,6B (~1,87 GB) y el Ling-3.0-tiny MoE (~4,85 GB, solo WebGPU, para ver el techo). Se fuera SmolLM2-135M y los Qwen2.5 de 2024: no daban la talla.
  • No todos los modelos publican el mismo cuantizado: el Ling-3.0-tiny SOLO tiene onnx/model_q4f16.onnx (INT4 con runtime y caché FP16). Esta web manda el dtype que declara cada ficha; forzarle un q4 a ese repo sería un 404. Y q4f16 no es un Q4_K_M de GGUF: no son comparables.
  • Lo de «WebGPU o, si no, WASM (CPU)» ya NO es cierto con este catálogo: comprobado con descarga real, el q4 y el q4f16 del Qwen3.5-0,8B terminan de bajar y luego fallan al crear la sesión en CPU («Could not find an implementation for GatherBlockQuantized»). Así que la web ya no te deja ir: si eliges WASM para un modelo declarado solo-WebGPU, para ANTES de descargar un byte y te lo dice (y el worker comprueba el adaptador GPU antes de bajar nada). Si tienes WebGPU, el dispositivo se pone solo en WebGPU al entrar en el paso 5.
  • La VRAM no la expone ningún navegador: cuando aparece, la ha escrito una persona. WebGPU se comprueba pidiendo un dispositivo de prueba y destruyéndolo; si está desactivado o ausente, se dice y se usa CPU.
  • Los modelos «nativos» (la familia Qwen3.5: 0,8B · 2B · 4B · 9B · 27B, y PaddleOCR-VL-1.6) son guías con enlaces oficiales: esta web no los ejecuta, no instala nada y no levanta servicios locales. Los Gigabytes citados son el fichero GGUF Q4_K_M medido en el repo, no el consumo total.
  • El offline total no está garantizado: la librería, el visor de PDF y los modelos vienen de CDN con versión fijada. Descargados una vez, el chat funciona sin conexión… hasta que el navegador decida limpiar la caché.

Fichas de modelo citadas:Qwen3.5-0.8B (texto, ONNX) · LFM2.5-2.6B-Uncensored (ONNX) · Ling-3.0-tiny (ONNX) · Ling-3.0-tiny (base) · Qwen3.5-0.8B GGUF · Qwen3.5-2B GGUF · Qwen3.5-4B GGUF · Qwen3.5-9B GGUF · Qwen3.5-27B GGUF · PaddleOCR-VL-1.6 · Transformers.js