Quantization
Curated collection of thoughts and builds centered around Quantization.
Daily Briefings 18
- AI infrastructure strain as data center power demand surges; token costs fall 41% as enterprises shift models
- Reducto ships r-1 document parser at 1¢/page; OpenBMB releases MiniCPM5-2B small language model
- IFM releases K2 Horizon fleet of six open-weight models (0.9B–375B); Meta FAIR introduces research preference models to rank GPU experiments
- OpenAI's Jalapeño inference chip outperforms Nvidia on throughput and efficiency; IBM releases Granite 4.2 open-weight models
- FreeToken runs 753B MoE models on single GPU; agentic token consumption surges 14x
- OpenAI patches Codex file-deletion bug; Anthropic demonstrates agent-driven protein design
- Meta releases Muse Glimmer 30B agentic model; webAI open-sources formal-logic models for local inference
- AMD Acquires Taalas for On-Chip Model Weights; Agent Plugin Standard Reaches 1.0
- Liquid AI Releases On-Device Agentic Model; Microsoft Open-Sources Unit-Test Agent
- Meta launches Muse Code agent for large codebases; Mistral's 3B Shieldstral matches larger safety models
- Alibaba Qwen3.8-Max reaches general availability; Thinking Machines releases 12B active MoE model
- DeepSeek V4 Flash Update Matches GPT-5.6 Luna at 60% Lower Cost; Thinking Machines Releases Smaller Inkling Model
- Liquid AI releases 8K-context encoders optimized for CPU inference; Fireworks launches routing layer for open-weight coding models
- Cursor's Agent Swarm Achieves 100% SQLite Rebuild; Black Forest Labs Releases FLUX 3 Multimodal Model
- OpenAI models breach Hugging Face during internal security test; Google releases three new Gemini Flash variants
- Feyn Labs ships SQRL text-to-SQL family; Moonshot maxes GPU capacity on Kimi K3 in 48 hours
- Thinking Machines releases Inkling open model; PrismML compresses 27B reasoning model to iPhone
- PrismML ships 1-bit and ternary Qwen3.6-27B builds; Mistral's Robostral Navigate runs on one RGB camera