{"success":true,"data":[{"id":"whisper-large-v3","name":"whisper-large-v3","displayName":"Whisper Large v3","developer":"OpenAI","type":"audio","parameters":1.55,"contextWindow":4096,"releaseDate":"2023-11-06","description":"Best open speech recognition - 99 languages supported","vramRequired":{"fp32":6.2,"fp16":3.1,"bf16":3.1,"int8":1.6,"int4":0.8,"q8_0":1.6,"q6_k":1.2,"q5_k_m":1,"q4_k_m":0.9,"q4_0":0.8,"q3_k_m":0.6,"q2_k":0.5,"awq":0.8,"gptq":0.8,"exl2":0.7},"benchmarks":{},"popularity":99,"tags":["transcription","multilingual","flagship"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-opus-4.5","name":"claude-opus-4.5","displayName":"Claude Opus 4.5","developer":"Anthropic","type":"llm","parameters":200,"contextWindow":200000,"releaseDate":"2025-11-24","description":"Anthropic's most intelligent model - best in world for coding, agents, and computer use. Features effort parameter for controlling reasoning depth, zoom computer use, and extended thinking.","vramRequired":{"fp32":800,"fp16":400,"bf16":400,"int8":200,"int4":100,"q8_0":200,"q6_k":150,"q5_k_m":130,"q4_k_m":110,"q4_0":100,"q3_k_m":80,"q2_k":60,"awq":100,"gptq":100,"exl2":90},"benchmarks":{"swebench":80.9,"mmlu":88.3,"humaneval":92.7,"math":74.6,"gpqa":59.4},"popularity":99,"tags":["flagship","coding","agents","computer-use","extended-thinking","effort-parameter"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4o","name":"gpt-4o","displayName":"GPT-4o","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":128000,"releaseDate":"2024-05-13","description":"OpenAI's flagship omni model — text, vision, and audio (API-only; weights not public)","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":88.7,"humaneval":90.2,"gsm8k":95.8},"popularity":99,"tags":["flagship","multimodal","omni","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-3.5-sonnet","name":"claude-3.5-sonnet","displayName":"Claude 3.5 Sonnet","developer":"Anthropic","type":"llm","parameters":175,"contextWindow":200000,"releaseDate":"2024-06-20","description":"Anthropic's most intelligent model - excels at complex reasoning, coding, and analysis","vramRequired":{"fp32":700,"fp16":350,"bf16":350,"int8":175,"int4":87.5,"q8_0":175,"q6_k":131.3,"q5_k_m":113.8,"q4_k_m":96.3,"q4_0":87.5,"q3_k_m":70,"q2_k":52.5,"awq":87.5,"gptq":87.5,"exl2":78.8},"benchmarks":{"mmlu":88.7,"humaneval":92,"gsm8k":96.4,"mtbench":9.4},"popularity":99,"tags":["flagship","reasoning","coding","multimodal","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.1-8b","name":"llama-3.1-8b","displayName":"Llama 3.1 8B","developer":"Meta","type":"llm","parameters":8,"contextWindow":128000,"releaseDate":"2024-07-23","description":"Most popular local LLM - runs on consumer hardware with excellent performance","vramRequired":{"fp32":32,"fp16":16,"bf16":16,"int8":8,"int4":4,"q8_0":8,"q6_k":6,"q5_k_m":5.2,"q4_k_m":4.4,"q4_0":4,"q3_k_m":3.2,"q2_k":2.4,"awq":4,"gptq":4,"exl2":3.6},"benchmarks":{"mmlu":73,"humaneval":72.6,"gsm8k":84.4},"popularity":99,"tags":["popular","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sora","name":"sora","displayName":"Sora","developer":"OpenAI","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-02","description":"OpenAI flagship video generation model. Creates realistic and imaginative videos up to 1 minute from text prompts. Understands motion, physics, and cinematic techniques.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":98,"tags":["flagship","text-to-video","image-to-video","highest-quality"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"stable-diffusion-xl","name":"stable-diffusion-xl","displayName":"Stable Diffusion XL 1.0","developer":"Stability AI","type":"image","parameters":6.6,"contextWindow":4096,"releaseDate":"2023-07-26","description":"Alias for SDXL 1.0 (sdxl-1.0) — industry-standard image generation model","vramRequired":{"fp32":26.4,"fp16":13.2,"bf16":13.2,"int8":6.6,"int4":3.3,"q8_0":6.6,"q6_k":5,"q5_k_m":4.3,"q4_k_m":3.6,"q4_0":3.3,"q3_k_m":2.6,"q2_k":2,"awq":3.3,"gptq":3.3,"exl2":3},"benchmarks":{},"popularity":98,"tags":["sdxl","flagship","high-resolution","popular","alias"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sdxl-1.0","name":"sdxl-1.0","displayName":"Stable Diffusion XL 1.0","developer":"Stability AI","type":"image","parameters":6.6,"contextWindow":4096,"releaseDate":"2023-07-26","description":"Industry-standard image generation model with excellent quality and flexibility","vramRequired":{"fp32":26.4,"fp16":13.2,"bf16":13.2,"int8":6.6,"int4":3.3,"q8_0":6.6,"q6_k":5,"q5_k_m":4.3,"q4_k_m":3.6,"q4_0":3.3,"q3_k_m":2.6,"q2_k":2,"awq":3.3,"gptq":3.3,"exl2":3},"benchmarks":{},"popularity":98,"tags":["sdxl","flagship","high-resolution","popular"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-r1","name":"deepseek-r1","displayName":"DeepSeek R1","developer":"DeepSeek","type":"llm","parameters":671,"contextWindow":128000,"releaseDate":"2025-01-20","description":"State-of-the-art reasoning model rivaling o1, with open weights","vramRequired":{"fp32":2684,"fp16":1342,"bf16":1342,"int8":671,"int4":335.5,"q8_0":671,"q6_k":503.3,"q5_k_m":436.2,"q4_k_m":369.1,"q4_0":335.5,"q3_k_m":268.4,"q2_k":201.3,"awq":335.5,"gptq":335.5,"exl2":302},"benchmarks":{"mmlu":90.8,"humaneval":97.3,"gsm8k":97.3,"math":79.8},"popularity":98,"tags":["reasoning","sota","moe","chain-of-thought"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.1-70b","name":"llama-3.1-70b","displayName":"Llama 3.1 70B","developer":"Meta","type":"llm","parameters":70,"contextWindow":128000,"releaseDate":"2024-07-23","description":"Excellent balance of capability and efficiency for local deployment","vramRequired":{"fp32":280,"fp16":140,"bf16":140,"int8":70,"int4":35,"q8_0":70,"q6_k":52.5,"q5_k_m":45.5,"q4_k_m":38.5,"q4_0":35,"q3_k_m":28,"q2_k":21,"awq":35,"gptq":35,"exl2":31.5},"benchmarks":{"mmlu":86,"humaneval":80.5,"gsm8k":95.1,"mtbench":8.9},"popularity":98,"tags":["popular","reasoning","coding","agentic"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-4-maverick","name":"llama-4-maverick","displayName":"Llama 4 Maverick","developer":"Meta","type":"llm","parameters":400,"contextWindow":1000000,"releaseDate":"2025-04-05","description":"Llama 4 Maverick — 17B active / 400B total MoE multimodal model. Best-in-class open multimodal performance vs GPT-4o / Gemini 2.0 class models at low active-parameter cost.","vramRequired":{"fp32":1600,"fp16":800,"bf16":800,"int8":400,"int4":200,"q8_0":400,"q6_k":300,"q5_k_m":260,"q4_k_m":220,"q4_0":200,"q3_k_m":160,"q2_k":120,"awq":200,"gptq":200,"exl2":180},"benchmarks":{"mmlu":87,"humaneval":90,"gsm8k":96},"popularity":98,"tags":["flagship","llama-4","moe","multimodal","1m-context"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.3-70b","name":"llama-3.3-70b","displayName":"Llama 3.3 70B","developer":"Meta","type":"llm","parameters":70,"contextWindow":128000,"releaseDate":"2024-12-06","description":"Latest Llama with improved tool use and multilingual capabilities","vramRequired":{"fp32":280,"fp16":140,"bf16":140,"int8":70,"int4":35,"q8_0":70,"q6_k":52.5,"q5_k_m":45.5,"q4_k_m":38.5,"q4_0":35,"q3_k_m":28,"q2_k":21,"awq":35,"gptq":35,"exl2":31.5},"benchmarks":{"mmlu":86,"humaneval":88.4,"gsm8k":95.1},"popularity":97,"tags":["latest","reasoning","coding","tool-use"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-4-scout","name":"llama-4-scout","displayName":"Llama 4 Scout","developer":"Meta","type":"llm","parameters":109,"contextWindow":10000000,"releaseDate":"2025-04-05","description":"Llama 4 Scout — 17B active / 109B total MoE multimodal model with industry-leading 10M context. Fits on a single H100 class GPU at full precision for many workloads.","vramRequired":{"fp32":436,"fp16":218,"bf16":218,"int8":109,"int4":54.5,"q8_0":109,"q6_k":81.8,"q5_k_m":70.9,"q4_k_m":60,"q4_0":54.5,"q3_k_m":43.6,"q2_k":32.7,"awq":54.5,"gptq":54.5,"exl2":49.1},"benchmarks":{"mmlu":87,"humaneval":90,"gsm8k":96},"popularity":97,"tags":["flagship","llama-4","moe","multimodal","10m-context"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4.1","name":"gpt-4.1","displayName":"GPT-4.1","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":1047576,"releaseDate":"2025-04-14","description":"OpenAI GPT-4.1 — strong coding and instruction following with up to 1M token context. API-only; successor quality tier above GPT-4o for many agent/coding tasks.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":50,"humaneval":45,"gsm8k":35},"popularity":96,"tags":["flagship","gpt-4.1","1m-context","api-only","coding"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"elevenlabs-multilingual-v2","name":"elevenlabs-multilingual-v2","displayName":"ElevenLabs Multilingual v2","developer":"ElevenLabs","type":"audio","parameters":1,"contextWindow":4096,"releaseDate":"2023-08-22","description":"Industry-leading voice synthesis with cloning","vramRequired":{"fp32":4,"fp16":2,"bf16":2,"int8":1,"int4":0.5,"q8_0":1,"q6_k":0.8,"q5_k_m":0.7,"q4_k_m":0.6,"q4_0":0.5,"q3_k_m":0.4,"q2_k":0.3,"awq":0.5,"gptq":0.5,"exl2":0.5},"benchmarks":{},"popularity":95,"tags":["tts","voice-cloning","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"whisper-large-v3-turbo","name":"whisper-large-v3-turbo","displayName":"Whisper Large v3 Turbo","developer":"OpenAI","type":"audio","parameters":0.8,"contextWindow":4096,"releaseDate":"2024-10-01","description":"8x faster Whisper with minimal quality loss","vramRequired":{"fp32":3.2,"fp16":1.6,"bf16":1.6,"int8":0.8,"int4":0.4,"q8_0":0.8,"q6_k":0.6,"q5_k_m":0.52,"q4_k_m":0.44,"q4_0":0.4,"q3_k_m":0.32,"q2_k":0.24,"awq":0.4,"gptq":0.4,"exl2":0.36},"benchmarks":{},"popularity":95,"tags":["transcription","fast","efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"bge-large-en-v1.5","name":"bge-large-en-v1.5","displayName":"BGE Large EN v1.5","developer":"BAAI","type":"embedding","parameters":0.335,"contextWindow":512,"releaseDate":"2023-09-12","description":"Best-in-class English embedding model for RAG applications","vramRequired":{"fp32":1.34,"fp16":0.67,"bf16":0.67,"int8":0.34,"int4":0.17,"q8_0":0.34,"q6_k":0.25,"q5_k_m":0.22,"q4_k_m":0.18,"q4_0":0.17,"q3_k_m":0.13,"q2_k":0.1,"awq":0.17,"gptq":0.17,"exl2":0.15},"benchmarks":{"mtbench":64.2},"popularity":95,"tags":["embedding","popular","rag"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"runway-gen3-alpha","name":"runway-gen3-alpha","displayName":"Runway Gen-3 Alpha","developer":"Runway","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-06","description":"Runway Gen-3 Alpha - major leap in video generation fidelity, consistency, and motion. Supports text-to-video, image-to-video, and motion brush controls.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":95,"tags":["gen-3","text-to-video","image-to-video","motion-brush"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"dall-e-3","name":"dall-e-3","displayName":"DALL·E 3","developer":"OpenAI","type":"image","parameters":12,"contextWindow":4096,"releaseDate":"2023-10-01","description":"OpenAI's latest image generation model","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{},"popularity":95,"tags":["openai","creative","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"flux-1-dev","name":"flux-1-dev","displayName":"FLUX.1 [dev]","developer":"Black Forest Labs","type":"image","parameters":12,"contextWindow":4096,"releaseDate":"2024-08-01","description":"State-of-the-art image generation with exceptional quality","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{},"popularity":95,"tags":["flux","high-quality","state-of-the-art"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sd-1.5","name":"sd-1.5","displayName":"Stable Diffusion 1.5","developer":"Stability AI","type":"image","parameters":0.86,"contextWindow":4096,"releaseDate":"2022-10-20","description":"Classic SD model with massive ecosystem of fine-tunes and LoRAs","vramRequired":{"fp32":3.44,"fp16":1.72,"bf16":1.72,"int8":0.86,"int4":0.43,"q8_0":0.86,"q6_k":0.65,"q5_k_m":0.56,"q4_k_m":0.47,"q4_0":0.43,"q3_k_m":0.34,"q2_k":0.26,"awq":0.43,"gptq":0.43,"exl2":0.39},"benchmarks":{},"popularity":95,"tags":["classic","lightweight","fine-tuning-friendly"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen2.5-coder-32b","name":"qwen2.5-coder-32b","displayName":"Qwen2.5 Coder 32B","developer":"Alibaba","type":"llm","parameters":32,"contextWindow":131072,"releaseDate":"2024-11-11","description":"State-of-the-art coding model - rivals GPT-4 on coding benchmarks","vramRequired":{"fp32":128,"fp16":64,"bf16":64,"int8":32,"int4":16,"q8_0":32,"q6_k":24,"q5_k_m":20.8,"q4_k_m":17.6,"q4_0":16,"q3_k_m":12.8,"q2_k":9.6,"awq":16,"gptq":16,"exl2":14.4},"benchmarks":{"humaneval":92.7,"codexEval":90},"popularity":95,"tags":["coding","best-in-class","code-generation"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-sonnet-4.5","name":"claude-sonnet-4.5","displayName":"Claude Sonnet 4.5","developer":"Anthropic","type":"llm","parameters":120,"contextWindow":200000,"releaseDate":"2025-09-29","description":"Best model in the world for agents, coding, and computer use. Enhanced domain knowledge in coding, finance, and cybersecurity.","vramRequired":{"fp32":480,"fp16":240,"bf16":240,"int8":120,"int4":60,"q8_0":120,"q6_k":90,"q5_k_m":78,"q4_k_m":66,"q4_0":60,"q3_k_m":48,"q2_k":36,"awq":60,"gptq":60,"exl2":54},"benchmarks":{"swebench":77.2,"humaneval":92.5,"mmlu":88,"math":72.4,"gpqa":57.1,"gsm8k":96.4},"popularity":95,"tags":["coding","agents","computer-use","balanced"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-r1-distill-llama-70b","name":"deepseek-r1-distill-llama-70b","displayName":"DeepSeek R1 Distill Llama 70B","developer":"DeepSeek","type":"llm","parameters":70,"contextWindow":128000,"releaseDate":"2025-01-20","description":"Distilled reasoning model based on Llama 70B architecture","vramRequired":{"fp32":280,"fp16":140,"bf16":140,"int8":70,"int4":35,"q8_0":70,"q6_k":52.5,"q5_k_m":45.5,"q4_k_m":38.5,"q4_0":35,"q3_k_m":28,"q2_k":21,"awq":35,"gptq":35,"exl2":31.5},"benchmarks":{"mmlu":86.5,"humaneval":85,"gsm8k":94.5},"popularity":95,"tags":["reasoning","distilled","efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4o-mini","name":"gpt-4o-mini","displayName":"GPT-4o Mini","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":128000,"releaseDate":"2024-07-18","description":"Small, fast, and affordable GPT-4o for most tasks (API-only; weights not public)","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":82,"humaneval":87},"popularity":95,"tags":["fast","efficient","multimodal","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemini-1.5-pro","name":"gemini-1.5-pro","displayName":"Gemini 1.5 Pro","developer":"Google","type":"llm","parameters":175,"contextWindow":2000000,"releaseDate":"2024-02-15","description":"Google's flagship with 2M token context - can process entire codebases","vramRequired":{"fp32":700,"fp16":350,"bf16":350,"int8":175,"int4":87.5,"q8_0":175,"q6_k":131.3,"q5_k_m":113.8,"q4_k_m":96.3,"q4_0":87.5,"q3_k_m":70,"q2_k":52.5,"awq":87.5,"gptq":87.5,"exl2":78.8},"benchmarks":{"mmlu":85.9,"humaneval":84.1,"gsm8k":94.4},"popularity":95,"tags":["long-context","multimodal","flagship","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"mistral-7b","name":"mistral-7b","displayName":"Mistral 7B","developer":"Mistral AI","type":"llm","parameters":7,"contextWindow":32768,"releaseDate":"2023-09-27","description":"The original Mistral - set new standards for 7B models","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"mmlu":62.5,"humaneval":29.3,"gsm8k":52.2},"popularity":95,"tags":["popular","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.1-405b","name":"llama-3.1-405b","displayName":"Llama 3.1 405B","developer":"Meta","type":"llm","parameters":405,"contextWindow":128000,"releaseDate":"2024-07-23","description":"Meta's largest and most capable open model with state-of-the-art performance","vramRequired":{"fp32":1620,"fp16":810,"bf16":810,"int8":405,"int4":202.5,"q8_0":405,"q6_k":303.8,"q5_k_m":263.3,"q4_k_m":222.8,"q4_0":202.5,"q3_k_m":162,"q2_k":121.5,"awq":202.5,"gptq":202.5,"exl2":182.3},"benchmarks":{"mmlu":88.6,"humaneval":89,"gsm8k":96.8,"mtbench":9.2},"popularity":95,"tags":["flagship","reasoning","coding","multilingual"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"openai-4o","name":"openai-4o","displayName":"GPT-4o","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":128000,"releaseDate":"2024-05-13","description":"OpenAI's GPT-4o — multimodal flagship with 128K context (text, image, audio).","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":50,"humaneval":30,"gsm8k":35},"popularity":94,"tags":["commercial","api-only","multimodal","flagship"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-r1-distill-qwen-7b","name":"deepseek-r1-distill-qwen-7b","displayName":"DeepSeek R1 Distill Qwen 7B","developer":"DeepSeek","type":"llm","parameters":7,"contextWindow":128000,"releaseDate":"2025-01-20","description":"Budget-friendly reasoning model for entry-level GPUs","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"mmlu":72,"humaneval":65,"gsm8k":82},"popularity":94,"tags":["reasoning","distilled","budget","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemma-3-27b","name":"gemma-3-27b","displayName":"Gemma 3 27B","developer":"Google","type":"llm","parameters":27,"contextWindow":128000,"releaseDate":"2025-03-12","description":"Gemma 3 27B — Google open multimodal model with 128K context, 140+ languages, and strong single-GPU efficiency.","vramRequired":{"fp32":108,"fp16":54,"bf16":54,"int8":27,"int4":13.5,"q8_0":27,"q6_k":20.3,"q5_k_m":17.6,"q4_k_m":14.9,"q4_0":13.5,"q3_k_m":10.8,"q2_k":8.1,"awq":13.5,"gptq":13.5,"exl2":12.2},"benchmarks":{"mmlu":78,"humaneval":53,"gsm8k":75},"popularity":94,"tags":["flagship","gemma-3","multimodal","open-weight"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4.1-mini","name":"gpt-4.1-mini","displayName":"GPT-4.1 mini","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":1047576,"releaseDate":"2025-04-14","description":"OpenAI GPT-4.1 mini — cheaper/faster GPT-4.1 tier with the same 1M context window for high-volume workloads.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":50,"humaneval":45,"gsm8k":35},"popularity":93,"tags":["gpt-4.1","mini","1m-context","api-only","cost-efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen3-8b","name":"qwen3-8b","displayName":"Qwen3 8B","developer":"Alibaba","type":"llm","parameters":8,"contextWindow":131072,"releaseDate":"2025-01-15","description":"Popular efficient model for consumer GPUs","vramRequired":{"fp32":32,"fp16":16,"bf16":16,"int8":8,"int4":4,"q8_0":8,"q6_k":6,"q5_k_m":5.2,"q4_k_m":4.4,"q4_0":4,"q3_k_m":3.2,"q2_k":2.4,"awq":4,"gptq":4,"exl2":3.6},"benchmarks":{"mmlu":74,"humaneval":70,"gsm8k":84},"popularity":93,"tags":["popular","efficient","budget"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen3-235b-a22b","name":"qwen3-235b-a22b","displayName":"Qwen3 235B-A22B","developer":"Alibaba","type":"llm","parameters":235,"contextWindow":131072,"releaseDate":"2025-01-15","description":"Alibaba flagship MoE model supporting 119 languages","vramRequired":{"fp32":940,"fp16":470,"bf16":470,"int8":235,"int4":117.5,"q8_0":235,"q6_k":176.3,"q5_k_m":152.8,"q4_k_m":129.3,"q4_0":117.5,"q3_k_m":94,"q2_k":70.5,"awq":117.5,"gptq":117.5,"exl2":105.8},"benchmarks":{"mmlu":92.3,"humaneval":88,"gsm8k":96.5,"aime25":92.3},"popularity":93,"tags":["flagship","moe","multilingual","119-languages"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"all-minilm-l6-v2","name":"all-minilm-l6-v2","displayName":"All-MiniLM-L6-v2","developer":"Sentence Transformers","type":"embedding","parameters":0.022,"contextWindow":256,"releaseDate":"2021-08-11","description":"Classic lightweight embedding - runs on CPU","vramRequired":{"fp32":0.09,"fp16":0.04,"bf16":0.04,"int8":0.02,"int4":0.01,"q8_0":0.02,"q6_k":0.02,"q5_k_m":0.01,"q4_k_m":0.01,"q4_0":0.01,"q3_k_m":0.01,"q2_k":0.01,"awq":0.01,"gptq":0.01,"exl2":0.01},"benchmarks":{},"popularity":92,"tags":["embedding","classic","cpu-only","popular"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"bge-m3","name":"bge-m3","displayName":"BGE-M3","developer":"BAAI","type":"embedding","parameters":0.568,"contextWindow":8192,"releaseDate":"2024-01-30","description":"Multi-lingual, multi-functionality, multi-granularity embedding","vramRequired":{"fp32":2.27,"fp16":1.14,"bf16":1.14,"int8":0.57,"int4":0.28,"q8_0":0.57,"q6_k":0.43,"q5_k_m":0.37,"q4_k_m":0.31,"q4_0":0.28,"q3_k_m":0.23,"q2_k":0.17,"awq":0.28,"gptq":0.28,"exl2":0.26},"benchmarks":{},"popularity":92,"tags":["embedding","multilingual","long-context"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"veo-2","name":"veo-2","displayName":"Veo 2","developer":"Google","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-12","description":"Google Veo 2 - generates 4K videos with cinematic quality. Understands real-world physics and human movement. Supports various styles from photorealistic to surreal.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":92,"tags":["veo","google","text-to-video","4k","cinematic"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"flux-1-schnell","name":"flux-1-schnell","displayName":"FLUX.1 [schnell]","developer":"Black Forest Labs","type":"image","parameters":12,"contextWindow":4096,"releaseDate":"2024-08-01","description":"Fast FLUX variant - 4-step generation with Apache 2.0 license","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{},"popularity":92,"tags":["flux","fast","commercial-friendly"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen2.5-coder-7b","name":"qwen2.5-coder-7b","displayName":"Qwen2.5 Coder 7B","developer":"Alibaba","type":"llm","parameters":7,"contextWindow":131072,"releaseDate":"2024-09-19","description":"Best coding model for consumer GPUs","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"humaneval":78},"popularity":92,"tags":["coding","consumer-gpu","popular"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.3-70b-instruct","name":"llama-3.3-70b-instruct","displayName":"Llama 3.3 70B Instruct","developer":"Meta","type":"llm","parameters":70,"contextWindow":128000,"releaseDate":"2024-12-06","description":"Multilingual large language model optimized for dialogue. Outperforms many open-source and closed models on common benchmarks. Supports 8 languages with 128K context.","vramRequired":{"fp16":140,"q8_0":74,"q4_k_m":42,"q4_0":40},"benchmarks":{"mmlu":86,"humaneval":88.4,"gsm8k":89},"popularity":92,"tags":["open-source","multilingual","instruction-tuned","meta"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"openai-4o-mini","name":"openai-4o-mini","displayName":"GPT-4o mini","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":128000,"releaseDate":"2024-07-18","description":"OpenAI's GPT-4o mini — affordable multimodal model with 128K context.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":50,"humaneval":30,"gsm8k":35},"popularity":92,"tags":["commercial","api-only","cost-efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-opus-4.1","name":"claude-opus-4.1","displayName":"Claude Opus 4.1","developer":"Anthropic","type":"llm","parameters":200,"contextWindow":200000,"releaseDate":"2025-08-05","description":"Hybrid reasoning model with superior performance for real-world coding and agentic tasks. Handles complex multi-step problems with rigor and attention to detail.","vramRequired":{"fp32":800,"fp16":400,"bf16":400,"int8":200,"int4":100,"q8_0":200,"q6_k":150,"q5_k_m":130,"q4_k_m":110,"q4_0":100,"q3_k_m":80,"q2_k":60,"awq":100,"gptq":100,"exl2":90},"benchmarks":{"swebench":74.5,"mmlu":88,"humaneval":92,"math":73.8,"gpqa":57.8},"popularity":92,"tags":["coding","agents","reasoning","extended-thinking"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-r1-distill-qwen-32b","name":"deepseek-r1-distill-qwen-32b","displayName":"DeepSeek R1 Distill Qwen 32B","developer":"DeepSeek","type":"llm","parameters":32,"contextWindow":128000,"releaseDate":"2025-01-20","description":"Consumer-friendly reasoning model distilled to Qwen 32B","vramRequired":{"fp32":128,"fp16":64,"bf16":64,"int8":32,"int4":16,"q8_0":32,"q6_k":24,"q5_k_m":20.8,"q4_k_m":17.6,"q4_0":16,"q3_k_m":12.8,"q2_k":9.6,"awq":16,"gptq":16,"exl2":14.4},"benchmarks":{"mmlu":82.5,"humaneval":80,"gsm8k":91},"popularity":92,"tags":["reasoning","distilled","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemini-2.0-flash","name":"gemini-2.0-flash","displayName":"Gemini 2.0 Flash","developer":"Google","type":"multimodal","parameters":30,"contextWindow":1000000,"releaseDate":"2024-12-11","description":"Fast multimodal model with 1M context and agentic capabilities","vramRequired":{"fp32":120,"fp16":60,"bf16":60,"int8":30,"int4":15,"q8_0":30,"q6_k":22.5,"q5_k_m":19.5,"q4_k_m":16.5,"q4_0":15,"q3_k_m":12,"q2_k":9,"awq":15,"gptq":15,"exl2":13.5},"benchmarks":{"mmlu":89,"humaneval":85},"popularity":92,"tags":["multimodal","agentic","fast"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-v3","name":"deepseek-v3","displayName":"DeepSeek V3","developer":"DeepSeek","type":"llm","parameters":671,"contextWindow":128000,"releaseDate":"2024-12-25","description":"State-of-the-art MoE model rivaling GPT-4 at fraction of compute","vramRequired":{"fp32":2684,"fp16":1342,"bf16":1342,"int8":671,"int4":335.5,"q8_0":671,"q6_k":503.3,"q5_k_m":436.2,"q4_k_m":369.1,"q4_0":335.5,"q3_k_m":268.4,"q2_k":201.3,"awq":335.5,"gptq":335.5,"exl2":302},"benchmarks":{"mmlu":88.5,"humaneval":91,"gsm8k":96},"popularity":92,"tags":["moe","flagship","reasoning","coding"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"mixtral-8x7b","name":"mixtral-8x7b","displayName":"Mixtral 8x7B","developer":"Mistral AI","type":"llm","parameters":46.7,"contextWindow":32768,"releaseDate":"2023-12-11","description":"Highly efficient MoE model - GPT-3.5 quality at fraction of compute","vramRequired":{"fp32":186.8,"fp16":93.4,"bf16":93.4,"int8":46.7,"int4":23.4,"q8_0":46.7,"q6_k":35,"q5_k_m":30.4,"q4_k_m":25.7,"q4_0":23.4,"q3_k_m":18.7,"q2_k":14,"awq":23.4,"gptq":23.4,"exl2":21},"benchmarks":{"mmlu":70.6,"humaneval":40.2,"gsm8k":74.4},"popularity":92,"tags":["moe","popular","efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen3-32b","name":"qwen3-32b","displayName":"Qwen3 32B","developer":"Alibaba","type":"llm","parameters":32,"contextWindow":131072,"releaseDate":"2025-01-15","description":"Dense 32B model with strong multilingual capabilities","vramRequired":{"fp32":128,"fp16":64,"bf16":64,"int8":32,"int4":16,"q8_0":32,"q6_k":24,"q5_k_m":20.8,"q4_k_m":17.6,"q4_0":16,"q3_k_m":12.8,"q2_k":9.6,"awq":16,"gptq":16,"exl2":14.4},"benchmarks":{"mmlu":84,"humaneval":82,"gsm8k":93},"popularity":91,"tags":["dense","multilingual","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"faster-whisper-large-v3","name":"faster-whisper-large-v3","displayName":"Faster Whisper Large v3","developer":"SYSTRAN","type":"audio","parameters":1.55,"contextWindow":4096,"releaseDate":"2023-11-15","description":"CTranslate2-optimized Whisper - 4x faster inference","vramRequired":{"fp32":6.2,"fp16":3.1,"bf16":3.1,"int8":1.6,"int4":0.8,"q8_0":1.6,"q6_k":1.2,"q5_k_m":1,"q4_k_m":0.9,"q4_0":0.8,"q3_k_m":0.6,"q2_k":0.5,"awq":0.8,"gptq":0.8,"exl2":0.7},"benchmarks":{},"popularity":90,"tags":["transcription","optimized","ctranslate2"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"bge-base-en-v1.5","name":"bge-base-en-v1.5","displayName":"BGE Base EN v1.5","developer":"BAAI","type":"embedding","parameters":0.109,"contextWindow":512,"releaseDate":"2023-09-12","description":"Efficient embedding model for resource-constrained environments","vramRequired":{"fp32":0.44,"fp16":0.22,"bf16":0.22,"int8":0.11,"int4":0.05,"q8_0":0.11,"q6_k":0.08,"q5_k_m":0.07,"q4_k_m":0.06,"q4_0":0.05,"q3_k_m":0.04,"q2_k":0.03,"awq":0.05,"gptq":0.05,"exl2":0.05},"benchmarks":{},"popularity":90,"tags":["embedding","efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"stable-video-diffusion-xt","name":"stable-video-diffusion-xt","displayName":"Stable Video Diffusion XT","developer":"Stability AI","type":"video","parameters":1.5,"contextWindow":4096,"releaseDate":"2023-11","description":"Stable Video Diffusion XT - open-source image-to-video model. Generates 25 frames at 576x1024 resolution. Can run locally on consumer hardware.","vramRequired":{"fp32":6,"fp16":3,"bf16":3,"int8":1.5,"int4":0.75,"q8_0":1.5,"q6_k":1.1,"q5_k_m":1,"q4_k_m":0.8,"q4_0":0.75,"q3_k_m":0.6,"q2_k":0.45,"awq":0.75,"gptq":0.75,"exl2":0.68},"benchmarks":{},"popularity":90,"tags":["open-source","image-to-video","local-inference","svd"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"runway-gen3-alpha-turbo","name":"runway-gen3-alpha-turbo","displayName":"Runway Gen-3 Alpha Turbo","developer":"Runway","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-08","description":"Fast variant of Gen-3 Alpha - 7x faster generation with slightly reduced quality. Ideal for rapid iteration and prototyping.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":90,"tags":["gen-3","turbo","fast","text-to-video"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sdxl-turbo","name":"sdxl-turbo","displayName":"SDXL Turbo","developer":"Stability AI","type":"image","parameters":6.6,"contextWindow":4096,"releaseDate":"2023-11-28","description":"Distilled SDXL for near-real-time generation (1-4 steps)","vramRequired":{"fp32":26.4,"fp16":13.2,"bf16":13.2,"int8":6.6,"int4":3.3,"q8_0":6.6,"q6_k":4.9,"q5_k_m":4.3,"q4_k_m":3.6,"q4_0":3.3,"q3_k_m":2.6,"q2_k":2,"awq":3.3,"gptq":3.3,"exl2":3},"benchmarks":{},"popularity":90,"tags":["sdxl","fast","real-time"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-opus-4","name":"claude-opus-4","displayName":"Claude Opus 4","developer":"Anthropic","type":"llm","parameters":200,"contextWindow":200000,"releaseDate":"2025-05-22","description":"World's best coding model at launch. Delivers sustained performance on long-running tasks requiring thousands of steps. Can work continuously for hours.","vramRequired":{"fp32":800,"fp16":400,"bf16":400,"int8":200,"int4":100,"q8_0":200,"q6_k":150,"q5_k_m":130,"q4_k_m":110,"q4_0":100,"q3_k_m":80,"q2_k":60,"awq":100,"gptq":100,"exl2":90},"benchmarks":{"swebench":72.5,"terminalbench":43.2,"mmlu":87.7,"humaneval":91.2,"math":71.9},"popularity":90,"tags":["flagship","coding","agents","long-running"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-r1-distill-qwen-14b","name":"deepseek-r1-distill-qwen-14b","displayName":"DeepSeek R1 Distill Qwen 14B","developer":"DeepSeek","type":"llm","parameters":14,"contextWindow":128000,"releaseDate":"2025-01-20","description":"Highly efficient reasoning model for consumer GPUs","vramRequired":{"fp32":56,"fp16":28,"bf16":28,"int8":14,"int4":7,"q8_0":14,"q6_k":10.5,"q5_k_m":9.1,"q4_k_m":7.7,"q4_0":7,"q3_k_m":5.6,"q2_k":4.2,"awq":7,"gptq":7,"exl2":6.3},"benchmarks":{"mmlu":78,"humaneval":72,"gsm8k":87},"popularity":90,"tags":["reasoning","distilled","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemini-1.5-flash","name":"gemini-1.5-flash","displayName":"Gemini 1.5 Flash","developer":"Google","type":"llm","parameters":30,"contextWindow":1000000,"releaseDate":"2024-05-14","description":"Fast Gemini with 1M context for high-volume applications","vramRequired":{"fp32":120,"fp16":60,"bf16":60,"int8":30,"int4":15,"q8_0":30,"q6_k":22.5,"q5_k_m":19.5,"q4_k_m":16.5,"q4_0":15,"q3_k_m":12,"q2_k":9,"awq":15,"gptq":15,"exl2":13.5},"benchmarks":{"mmlu":78.9},"popularity":90,"tags":["fast","long-context","multimodal","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-3.5-haiku","name":"claude-3.5-haiku","displayName":"Claude 3.5 Haiku","developer":"Anthropic","type":"llm","parameters":20,"contextWindow":200000,"releaseDate":"2024-10-29","description":"Fast and cost-effective Claude for high-volume applications","vramRequired":{"fp32":80,"fp16":40,"bf16":40,"int8":20,"int4":10,"q8_0":20,"q6_k":15,"q5_k_m":13,"q4_k_m":11,"q4_0":10,"q3_k_m":8,"q2_k":6,"awq":10,"gptq":10,"exl2":9},"benchmarks":{"mmlu":78},"popularity":90,"tags":["fast","efficient","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen-2.5-7b","name":"qwen-2.5-7b","displayName":"Qwen 2.5 7B","developer":"Alibaba","type":"llm","parameters":7,"contextWindow":131072,"releaseDate":"2024-09-19","description":"Best-in-class 7B model with 128K context","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"mmlu":74,"humaneval":70},"popularity":90,"tags":["popular","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen-2.5-72b","name":"qwen-2.5-72b","displayName":"Qwen 2.5 72B","developer":"Alibaba","type":"llm","parameters":72,"contextWindow":131072,"releaseDate":"2024-09-19","description":"Alibaba's flagship model - rivals GPT-4 on many benchmarks","vramRequired":{"fp32":288,"fp16":144,"bf16":144,"int8":72,"int4":36,"q8_0":72,"q6_k":54,"q5_k_m":46.8,"q4_k_m":39.6,"q4_0":36,"q3_k_m":28.8,"q2_k":21.6,"awq":36,"gptq":36,"exl2":32.4},"benchmarks":{"mmlu":86.1,"humaneval":86.6,"gsm8k":95.8,"mtbench":9.1},"popularity":90,"tags":["flagship","reasoning","coding","math"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.2-11b-vision","name":"llama-3.2-11b-vision","displayName":"Llama 3.2 11B Vision","developer":"Meta","type":"multimodal","parameters":11,"contextWindow":128000,"releaseDate":"2024-09-25","description":"Efficient multimodal model for consumer hardware","vramRequired":{"fp32":44,"fp16":22,"bf16":22,"int8":11,"int4":5.5,"q8_0":11,"q6_k":8.3,"q5_k_m":7.2,"q4_k_m":6.1,"q4_0":5.5,"q3_k_m":4.4,"q2_k":3.3,"awq":5.5,"gptq":5.5,"exl2":5},"benchmarks":{"mmlu":62,"humaneval":40,"gsm8k":52},"popularity":90,"tags":["multimodal","vision","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemma-3-12b","name":"gemma-3-12b","displayName":"Gemma 3 12B","developer":"Google","type":"llm","parameters":12,"contextWindow":128000,"releaseDate":"2025-03-12","description":"Gemma 3 12B — mid-size multimodal open model with 128K context for consumer and prosumer GPUs.","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{"mmlu":67,"humaneval":45,"gsm8k":57},"popularity":90,"tags":["gemma-3","multimodal","open-weight"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen3-14b","name":"qwen3-14b","displayName":"Qwen3 14B","developer":"Alibaba","type":"llm","parameters":14,"contextWindow":131072,"releaseDate":"2025-01-15","description":"Efficient 14B model for consumer hardware","vramRequired":{"fp32":56,"fp16":28,"bf16":28,"int8":14,"int4":7,"q8_0":14,"q6_k":10.5,"q5_k_m":9.1,"q4_k_m":7.7,"q4_0":7,"q3_k_m":5.6,"q2_k":4.2,"awq":7,"gptq":7,"exl2":6.3},"benchmarks":{"mmlu":79,"humaneval":75,"gsm8k":88},"popularity":89,"tags":["efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"xtts-v2","name":"xtts-v2","displayName":"XTTS v2","developer":"Coqui","type":"audio","parameters":0.5,"contextWindow":4096,"releaseDate":"2023-11-01","description":"Best open-source voice cloning with 17 languages","vramRequired":{"fp32":2,"fp16":1,"bf16":1,"int8":0.5,"int4":0.25,"q8_0":0.5,"q6_k":0.38,"q5_k_m":0.33,"q4_k_m":0.28,"q4_0":0.25,"q3_k_m":0.2,"q2_k":0.15,"awq":0.25,"gptq":0.25,"exl2":0.23},"benchmarks":{},"popularity":88,"tags":["tts","voice-cloning","open-source"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"all-mpnet-base-v2","name":"all-mpnet-base-v2","displayName":"All-MPNet-Base-v2","developer":"Sentence Transformers","type":"embedding","parameters":0.109,"contextWindow":384,"releaseDate":"2021-08-11","description":"Higher quality classic embedding","vramRequired":{"fp32":0.44,"fp16":0.22,"bf16":0.22,"int8":0.11,"int4":0.05,"q8_0":0.11,"q6_k":0.08,"q5_k_m":0.07,"q4_k_m":0.06,"q4_0":0.05,"q3_k_m":0.04,"q2_k":0.03,"awq":0.05,"gptq":0.05,"exl2":0.05},"benchmarks":{},"popularity":88,"tags":["embedding","high-quality","classic"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"nomic-embed-text-v1.5","name":"nomic-embed-text-v1.5","displayName":"Nomic Embed Text v1.5","developer":"Nomic AI","type":"embedding","parameters":0.137,"contextWindow":8192,"releaseDate":"2024-02-14","description":"Matryoshka embedding with variable dimension support","vramRequired":{"fp32":0.55,"fp16":0.27,"bf16":0.27,"int8":0.14,"int4":0.07,"q8_0":0.14,"q6_k":0.1,"q5_k_m":0.09,"q4_k_m":0.08,"q4_0":0.07,"q3_k_m":0.05,"q2_k":0.04,"awq":0.07,"gptq":0.07,"exl2":0.06},"benchmarks":{},"popularity":88,"tags":["embedding","matryoshka","variable-dimensions"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"e5-large-v2","name":"e5-large-v2","displayName":"E5 Large v2","developer":"Microsoft","type":"embedding","parameters":0.335,"contextWindow":512,"releaseDate":"2023-07-07","description":"Microsoft's high-quality embedding model","vramRequired":{"fp32":1.34,"fp16":0.67,"bf16":0.67,"int8":0.34,"int4":0.17,"q8_0":0.34,"q6_k":0.25,"q5_k_m":0.22,"q4_k_m":0.18,"q4_0":0.17,"q3_k_m":0.13,"q2_k":0.1,"awq":0.17,"gptq":0.17,"exl2":0.15},"benchmarks":{},"popularity":88,"tags":["embedding","microsoft"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"stable-video-diffusion","name":"stable-video-diffusion","displayName":"Stable Video Diffusion","developer":"Stability AI","type":"video","parameters":1.5,"contextWindow":4096,"releaseDate":"2023-11","description":"Stable Video Diffusion - base image-to-video model. Generates 14 frames at 576x1024 resolution. Foundation for video generation on consumer hardware.","vramRequired":{"fp32":6,"fp16":3,"bf16":3,"int8":1.5,"int4":0.75,"q8_0":1.5,"q6_k":1.1,"q5_k_m":1,"q4_k_m":0.8,"q4_0":0.75,"q3_k_m":0.6,"q2_k":0.45,"awq":0.75,"gptq":0.75,"exl2":0.68},"benchmarks":{},"popularity":88,"tags":["open-source","image-to-video","local-inference","svd"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"pika-1.5","name":"pika-1.5","displayName":"Pika 1.5","developer":"Pika Labs","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-11","description":"Pika 1.5 with Pikaffects - creative video effects like Crush It, Inflate, Melt, Explode, Cake-ify, and more. Makes physics-defying transformations possible.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":88,"tags":["pika","text-to-video","pikaffects","creative-effects"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"imagen-3","name":"imagen-3","displayName":"Imagen 3","developer":"Google","type":"image","parameters":20,"contextWindow":4096,"releaseDate":"2024-08-01","description":"Google's highest quality image generation","vramRequired":{"fp32":80,"fp16":40,"bf16":40,"int8":20,"int4":10,"q8_0":20,"q6_k":15,"q5_k_m":13,"q4_k_m":11,"q4_0":10,"q3_k_m":8,"q2_k":6,"awq":10,"gptq":10,"exl2":9},"benchmarks":{},"popularity":88,"tags":["google","photorealistic","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"controlnet-sdxl","name":"controlnet-sdxl","displayName":"ControlNet SDXL","developer":"Various","type":"image","parameters":2.5,"contextWindow":4096,"releaseDate":"2023-09-01","description":"Controlled generation for SDXL - pose, depth, canny, etc.","vramRequired":{"fp32":10,"fp16":5,"bf16":5,"int8":2.5,"int4":1.3,"q8_0":2.5,"q6_k":1.9,"q5_k_m":1.6,"q4_k_m":1.4,"q4_0":1.3,"q3_k_m":1,"q2_k":0.8,"awq":1.3,"gptq":1.3,"exl2":1.1},"benchmarks":{},"popularity":88,"tags":["controlnet","controlled-generation","addon"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"flux-1-pro","name":"flux-1-pro","displayName":"FLUX.1 [pro]","developer":"Black Forest Labs","type":"image","parameters":12,"contextWindow":4096,"releaseDate":"2024-08-01","description":"Highest quality FLUX - API access only","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{},"popularity":88,"tags":["flux","premium","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sd3.5-large","name":"sd3.5-large","displayName":"Stable Diffusion 3.5 Large","developer":"Stability AI","type":"image","parameters":8.1,"contextWindow":4096,"releaseDate":"2024-10-22","description":"Largest open SD3 model with best quality","vramRequired":{"fp32":32.4,"fp16":16.2,"bf16":16.2,"int8":8.1,"int4":4.1,"q8_0":8.1,"q6_k":6.1,"q5_k_m":5.3,"q4_k_m":4.5,"q4_0":4.1,"q3_k_m":3.2,"q2_k":2.4,"awq":4.1,"gptq":4.1,"exl2":3.6},"benchmarks":{},"popularity":88,"tags":["sd3.5","high-quality","flagship"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen2.5-coder-14b","name":"qwen2.5-coder-14b","displayName":"Qwen2.5 Coder 14B","developer":"Alibaba","type":"llm","parameters":14,"contextWindow":131072,"releaseDate":"2024-11-11","description":"Strong coding performance in efficient package","vramRequired":{"fp32":56,"fp16":28,"bf16":28,"int8":14,"int4":7,"q8_0":14,"q6_k":10.5,"q5_k_m":9.1,"q4_k_m":7.7,"q4_0":7,"q3_k_m":5.6,"q2_k":4.2,"awq":7,"gptq":7,"exl2":6.3},"benchmarks":{"humaneval":85},"popularity":88,"tags":["coding","efficient"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"phi-4","name":"phi-4","displayName":"Phi-4","developer":"Microsoft","type":"llm","parameters":14,"contextWindow":16384,"releaseDate":"2024-12-12","description":"14B parameter small language model specializing in complex reasoning and math. State-of-the-art SLM performance despite smaller size.","vramRequired":{"fp16":28,"q8_0":15,"q4_k_m":9,"q4_0":8},"benchmarks":{"mmlu":84.8,"math":80.4,"humaneval":82.6},"popularity":88,"tags":["slm","reasoning","math","efficient","microsoft"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4.1-nano","name":"gpt-4.1-nano","displayName":"GPT-4.1 nano","developer":"OpenAI","type":"llm","parameters":0,"contextWindow":1047576,"releaseDate":"2025-04-14","description":"OpenAI GPT-4.1 nano — lowest-cost GPT-4.1 tier for classification, simple extraction, and high-throughput tasks.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{"mmlu":50,"humaneval":30,"gsm8k":35},"popularity":88,"tags":["gpt-4.1","nano","1m-context","api-only","budget"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-haiku-4.5","name":"claude-haiku-4.5","displayName":"Claude Haiku 4.5","developer":"Anthropic","type":"llm","parameters":40,"contextWindow":200000,"releaseDate":"2025-10-15","description":"Near-frontier intelligence at blazing speed. Matches Sonnet 4 performance at one-third cost and 2x speed. Ideal for high-volume, latency-sensitive applications.","vramRequired":{"fp32":160,"fp16":80,"bf16":80,"int8":40,"int4":20,"q8_0":40,"q6_k":30,"q5_k_m":26,"q4_k_m":22,"q4_0":20,"q3_k_m":16,"q2_k":12,"awq":20,"gptq":20,"exl2":18},"benchmarks":{"mmlu":85.9,"humaneval":88.3,"math":69.2},"popularity":88,"tags":["fast","efficient","coding","agents"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen3-4b","name":"qwen3-4b","displayName":"Qwen3 4B","developer":"Alibaba","type":"llm","parameters":4,"contextWindow":131072,"releaseDate":"2025-01-15","description":"Lightweight model for edge deployment","vramRequired":{"fp32":16,"fp16":8,"bf16":8,"int8":4,"int4":2,"q8_0":4,"q6_k":3,"q5_k_m":2.6,"q4_k_m":2.2,"q4_0":2,"q3_k_m":1.6,"q2_k":1.2,"awq":2,"gptq":2,"exl2":1.8},"benchmarks":{"mmlu":68,"humaneval":60,"gsm8k":76},"popularity":88,"tags":["edge","efficient","mobile"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gpt-4-turbo","name":"gpt-4-turbo","displayName":"GPT-4 Turbo","developer":"OpenAI","type":"llm","parameters":175,"contextWindow":128000,"releaseDate":"2024-04-09","description":"GPT-4 with vision and 128K context","vramRequired":{"fp32":700,"fp16":350,"bf16":350,"int8":175,"int4":87.5,"q8_0":175,"q6_k":131.3,"q5_k_m":113.8,"q4_k_m":96.3,"q4_0":87.5,"q3_k_m":70,"q2_k":52.5,"awq":87.5,"gptq":87.5,"exl2":78.8},"benchmarks":{"mmlu":86.4,"humaneval":87.1},"popularity":88,"tags":["gpt-4","vision","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemma-2-9b","name":"gemma-2-9b","displayName":"Gemma 2 9B","developer":"Google","type":"llm","parameters":9,"contextWindow":8192,"releaseDate":"2024-06-27","description":"Efficient 9B model with strong instruction following","vramRequired":{"fp32":36,"fp16":18,"bf16":18,"int8":9,"int4":4.5,"q8_0":9,"q6_k":6.8,"q5_k_m":5.9,"q4_k_m":5,"q4_0":4.5,"q3_k_m":3.6,"q2_k":2.7,"awq":4.5,"gptq":4.5,"exl2":4.1},"benchmarks":{"mmlu":71.3,"humaneval":40.2},"popularity":88,"tags":["google","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"mistral-nemo-12b","name":"mistral-nemo-12b","displayName":"Mistral Nemo 12B","developer":"Mistral AI","type":"llm","parameters":12,"contextWindow":128000,"releaseDate":"2024-07-18","description":"Efficient 12B model with 128K context - great for consumer GPUs","vramRequired":{"fp32":48,"fp16":24,"bf16":24,"int8":12,"int4":6,"q8_0":12,"q6_k":9,"q5_k_m":7.8,"q4_k_m":6.6,"q4_0":6,"q3_k_m":4.8,"q2_k":3.6,"awq":6,"gptq":6,"exl2":5.4},"benchmarks":{"mmlu":68},"popularity":88,"tags":["long-context","efficient","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"llama-3.2-3b","name":"llama-3.2-3b","displayName":"Llama 3.2 3B","developer":"Meta","type":"llm","parameters":3,"contextWindow":128000,"releaseDate":"2024-09-25","description":"Compact model for edge deployment and low-resource environments","vramRequired":{"fp32":12,"fp16":6,"bf16":6,"int8":3,"int4":1.5,"q8_0":3,"q6_k":2.3,"q5_k_m":2,"q4_k_m":1.7,"q4_0":1.5,"q3_k_m":1.2,"q2_k":0.9,"awq":1.5,"gptq":1.5,"exl2":1.4},"benchmarks":{"mmlu":55,"humaneval":32,"gsm8k":42},"popularity":88,"tags":["lightweight","edge","mobile"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gemma-3-4b","name":"gemma-3-4b","displayName":"Gemma 3 4B","developer":"Google","type":"llm","parameters":4,"contextWindow":128000,"releaseDate":"2025-03-12","description":"Gemma 3 4B — compact multimodal open model for edge and consumer hardware with 128K context.","vramRequired":{"fp32":16,"fp16":8,"bf16":8,"int8":4,"int4":2,"q8_0":4,"q6_k":3,"q5_k_m":2.6,"q4_k_m":2.2,"q4_0":2,"q3_k_m":1.6,"q2_k":1.2,"awq":2,"gptq":2,"exl2":1.8},"benchmarks":{"mmlu":60,"humaneval":37,"gsm8k":47},"popularity":88,"tags":["gemma-3","multimodal","edge","open-weight"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"luma-dream-machine","name":"luma-dream-machine","displayName":"Luma Dream Machine","developer":"Luma AI","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-06","description":"Luma Dream Machine - fast, high-quality video generation. Generates 5-second clips in about 120 seconds. Known for realistic motion and physics.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":87,"tags":["dream-machine","text-to-video","fast","high-quality"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sd3.5-large-turbo","name":"sd3.5-large-turbo","displayName":"SD 3.5 Large Turbo","developer":"Stability AI","type":"image","parameters":8.1,"contextWindow":4096,"releaseDate":"2024-10-22","description":"Fast version of SD3.5 Large (4-step generation)","vramRequired":{"fp32":32.4,"fp16":16.2,"bf16":16.2,"int8":8.1,"int4":4.1,"q8_0":8.1,"q6_k":6.1,"q5_k_m":5.3,"q4_k_m":4.5,"q4_0":4.1,"q3_k_m":3.2,"q2_k":2.4,"awq":4.1,"gptq":4.1,"exl2":3.6},"benchmarks":{},"popularity":86,"tags":["sd3.5","fast","turbo"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"musicgen-large","name":"musicgen-large","displayName":"MusicGen Large","developer":"Meta","type":"audio","parameters":3.3,"contextWindow":4096,"releaseDate":"2023-06-08","description":"Generate music from text descriptions","vramRequired":{"fp32":13.2,"fp16":6.6,"bf16":6.6,"int8":3.3,"int4":1.7,"q8_0":3.3,"q6_k":2.5,"q5_k_m":2.1,"q4_k_m":1.8,"q4_0":1.7,"q3_k_m":1.3,"q2_k":1,"awq":1.7,"gptq":1.7,"exl2":1.5},"benchmarks":{},"popularity":85,"tags":["music","creative","meta"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"whisper-medium","name":"whisper-medium","displayName":"Whisper Medium","developer":"OpenAI","type":"audio","parameters":0.77,"contextWindow":4096,"releaseDate":"2022-09-21","description":"Balanced speed and accuracy for most use cases","vramRequired":{"fp32":3.08,"fp16":1.54,"bf16":1.54,"int8":0.77,"int4":0.39,"q8_0":0.77,"q6_k":0.58,"q5_k_m":0.5,"q4_k_m":0.42,"q4_0":0.39,"q3_k_m":0.31,"q2_k":0.23,"awq":0.39,"gptq":0.39,"exl2":0.35},"benchmarks":{},"popularity":85,"tags":["transcription","balanced"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"gte-qwen2-7b-instruct","name":"gte-qwen2-7b-instruct","displayName":"GTE-Qwen2 7B Instruct","developer":"Alibaba","type":"embedding","parameters":7,"contextWindow":131072,"releaseDate":"2024-06-15","description":"State-of-the-art embedding with 128K context","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{},"popularity":85,"tags":["embedding","long-context","multilingual"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"bge-small-en-v1.5","name":"bge-small-en-v1.5","displayName":"BGE Small EN v1.5","developer":"BAAI","type":"embedding","parameters":0.033,"contextWindow":512,"releaseDate":"2023-09-12","description":"Smallest BGE for edge deployment","vramRequired":{"fp32":0.13,"fp16":0.07,"bf16":0.07,"int8":0.03,"int4":0.02,"q8_0":0.03,"q6_k":0.02,"q5_k_m":0.02,"q4_k_m":0.02,"q4_0":0.02,"q3_k_m":0.01,"q2_k":0.01,"awq":0.02,"gptq":0.02,"exl2":0.01},"benchmarks":{},"popularity":85,"tags":["embedding","tiny","cpu-friendly"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"veo","name":"veo","displayName":"Veo","developer":"Google","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-05","description":"Google Veo - original video generation model. Generates high-quality 1080p videos from text prompts.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":85,"tags":["veo","google","text-to-video"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"kling-1.5","name":"kling-1.5","displayName":"Kling 1.5","developer":"Kuaishou","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2024-10","description":"Kling 1.5 from Kuaishou - generates videos up to 2 minutes. Known for realistic human motion and physics. Strong competitor to Sora.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":85,"tags":["kling","text-to-video","long-form","chinese"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"runway-gen2","name":"runway-gen2","displayName":"Runway Gen-2","developer":"Runway","type":"video","parameters":0,"contextWindow":4096,"releaseDate":"2023-06","description":"Runway Gen-2 - previous generation model still available. More affordable option for basic video generation needs.","vramRequired":{"fp16":0,"q8_0":0,"q4_k_m":0,"q4_0":0},"benchmarks":{},"popularity":85,"tags":["gen-2","text-to-video","legacy"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"ideogram-v2","name":"ideogram-v2","displayName":"Ideogram 2.0","developer":"Ideogram","type":"image","parameters":10,"contextWindow":4096,"releaseDate":"2024-08-21","description":"Best-in-class text rendering in images","vramRequired":{"fp32":40,"fp16":20,"bf16":20,"int8":10,"int4":5,"q8_0":10,"q6_k":7.5,"q5_k_m":6.5,"q4_k_m":5.5,"q4_0":5,"q3_k_m":4,"q2_k":3,"awq":5,"gptq":5,"exl2":4.5},"benchmarks":{},"popularity":85,"tags":["text-in-image","typography","api-only"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"animatediff-v3","name":"animatediff-v3","displayName":"AnimateDiff v3","developer":"AnimateDiff","type":"video","parameters":1.5,"contextWindow":4096,"releaseDate":"2024-01-15","description":"Animation module for Stable Diffusion models","vramRequired":{"fp32":6,"fp16":3,"bf16":3,"int8":1.5,"int4":0.8,"q8_0":1.5,"q6_k":1.1,"q5_k_m":1,"q4_k_m":0.8,"q4_0":0.8,"q3_k_m":0.6,"q2_k":0.5,"awq":0.8,"gptq":0.8,"exl2":0.7},"benchmarks":{},"popularity":85,"tags":["animation","motion","sd-compatible"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"sd3-medium","name":"sd3-medium","displayName":"Stable Diffusion 3 Medium","developer":"Stability AI","type":"image","parameters":2,"contextWindow":4096,"releaseDate":"2024-06-12","description":"Latest SD architecture with improved text rendering and composition","vramRequired":{"fp32":8,"fp16":4,"bf16":4,"int8":2,"int4":1,"q8_0":2,"q6_k":1.5,"q5_k_m":1.3,"q4_k_m":1.1,"q4_0":1,"q3_k_m":0.8,"q2_k":0.6,"awq":1,"gptq":1,"exl2":0.9},"benchmarks":{},"popularity":85,"tags":["sd3","text-rendering","new-architecture"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"deepseek-coder-v2-236b","name":"deepseek-coder-v2-236b","displayName":"DeepSeek Coder V2 236B","developer":"DeepSeek","type":"llm","parameters":236,"contextWindow":128000,"releaseDate":"2024-06-17","description":"Massive MoE coding model with excellent performance","vramRequired":{"fp32":944,"fp16":472,"bf16":472,"int8":236,"int4":118,"q8_0":236,"q6_k":177,"q5_k_m":153.4,"q4_k_m":129.8,"q4_0":118,"q3_k_m":94.4,"q2_k":70.8,"awq":118,"gptq":118,"exl2":106.2},"benchmarks":{"humaneval":90.2,"codexEval":88},"popularity":85,"tags":["coding","moe","flagship"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwq-32b-preview","name":"qwq-32b-preview","displayName":"QwQ-32B-Preview","developer":"Alibaba","type":"llm","parameters":32.5,"contextWindow":32768,"releaseDate":"2024-11-27","description":"Experimental reasoning model from Qwen Team. Excels in math and coding with step-by-step thinking. 32B parameters with advanced analytical capabilities.","vramRequired":{"fp16":65,"q8_0":35,"q4_k_m":20,"q4_0":18},"benchmarks":{"math":90.6,"gpqa":65.2},"popularity":85,"tags":["reasoning","math","coding","open-source","alibaba"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"claude-sonnet-4","name":"claude-sonnet-4","displayName":"Claude Sonnet 4","developer":"Anthropic","type":"llm","parameters":100,"contextWindow":200000,"releaseDate":"2025-05-22","description":"Significant upgrade to Sonnet 3.7. Excels in coding and reasoning with enhanced steerability. Optimal mix of capability and practicality.","vramRequired":{"fp32":400,"fp16":200,"bf16":200,"int8":100,"int4":50,"q8_0":100,"q6_k":75,"q5_k_m":65,"q4_k_m":55,"q4_0":50,"q3_k_m":40,"q2_k":30,"awq":50,"gptq":50,"exl2":45},"benchmarks":{"swebench":72.7,"mmlu":87.2,"humaneval":90.8,"math":70.4,"gsm8k":95.1},"popularity":85,"tags":["coding","balanced","agents"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"grok-3","name":"grok-3","displayName":"Grok 3","developer":"xAI","type":"llm","parameters":314,"contextWindow":128000,"releaseDate":"2025-01-10","description":"xAI flagship reasoning model with real-time knowledge","vramRequired":{"fp32":1256,"fp16":628,"bf16":628,"int8":314,"int4":157,"q8_0":314,"q6_k":235.5,"q5_k_m":204.1,"q4_k_m":172.7,"q4_0":157,"q3_k_m":125.6,"q2_k":94.2,"awq":157,"gptq":157,"exl2":141.3},"benchmarks":{"mmlu":91,"humaneval":90,"gsm8k":96},"popularity":85,"tags":["proprietary","reasoning","real-time"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"codestral-22b","name":"codestral-22b","displayName":"Codestral 22B","developer":"Mistral AI","type":"llm","parameters":22,"contextWindow":32768,"releaseDate":"2024-05-29","description":"Mistral's flagship code model","vramRequired":{"fp32":88,"fp16":44,"bf16":44,"int8":22,"int4":11,"q8_0":22,"q6_k":16.5,"q5_k_m":14.3,"q4_k_m":12.1,"q4_0":11,"q3_k_m":8.8,"q2_k":6.6,"awq":11,"gptq":11,"exl2":9.9},"benchmarks":{"humaneval":81.1},"popularity":85,"tags":["coding","mistral","flagship"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"zephyr-7b-beta","name":"zephyr-7b-beta","displayName":"Zephyr 7B Beta","developer":"Hugging Face","type":"llm","parameters":7,"contextWindow":8192,"releaseDate":"2023-10-25","description":"DPO-tuned Mistral with excellent chat performance","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"mtbench":7.34},"popularity":85,"tags":["chat","dpo","helpful"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true},{"id":"qwen2-vl-7b","name":"qwen2-vl-7b","displayName":"Qwen2-VL 7B","developer":"Alibaba","type":"multimodal","parameters":7,"contextWindow":32768,"releaseDate":"2024-08-29","description":"Efficient vision-language model for consumer hardware","vramRequired":{"fp32":28,"fp16":14,"bf16":14,"int8":7,"int4":3.5,"q8_0":7,"q6_k":5.3,"q5_k_m":4.6,"q4_k_m":3.9,"q4_0":3.5,"q3_k_m":2.8,"q2_k":2.1,"awq":3.5,"gptq":3.5,"exl2":3.2},"benchmarks":{"mmlu":62,"humaneval":40,"gsm8k":52},"popularity":85,"tags":["multimodal","vision","consumer-gpu"],"capabilities":[],"languages":[],"quantizations":[],"isOpenSource":true,"apiAvailable":false,"localRunnable":true}],"meta":{"total":299,"limit":100,"offset":0,"cached":false,"source":"models-library","lastUpdated":"2026-08-21T16:47:07.570Z"}}