Skip to content

#llm

47 bài viết
· 7 phút đọc

GPT-5.6 Luna Giảm 80%: Kinh Tế Học Mới Của AI Products

OpenAI vừa cắt giảm giá GPT-5.6 Luna 80% và Terra 20%. Kết hợp với hiệu suất token tăng 15% nhờ speculative decoding, bài toán chi phí cho AI products đã thay đổi căn bản. Đây là cách tư duy lại chiến lược model routing để tận dụng tiết kiệm mà không đánh đổi chất lượng ở nơi quan trọng.

· 8 phút đọc

OpenAI Astra Giải 10 Bài Toán Mở — Và Bài Học Thực Sự Là Về Sự Tin Tưởng

Astra phá vỡ một conjecture của Erdős từ thập kỷ trước và công bố Lean-verified proofs trên GitHub với chi phí $2,000. Fields Medalist Timothy Gowers gọi một proof xứng đáng đăng Annals. Đột phá không phải là AI giải được toán khó — mà là cơ chế: machine-verifiable output như chuẩn mới để tin tưởng công việc của AI.

· 9 phút đọc

Vì sao 'Software Factory' thất bại (và điều gì thực sự hiệu quả): Hướng dẫn của Tech Lead về series HumanLayer

Hai bài viết của Dex Horthy (HumanLayer) đi tới cùng một kết luận từ hai hướng khác nhau: các 'software factory' kiểu lights-off (bỏ qua code review) không hoạt động, vì huấn luyện RL không có cách nào thưởng cho kiến trúc tốt — chỉ thưởng cho việc pass test. Cách khắc phục không phải là dùng ít AI hơn, mà là front-load cấu trúc: research/plan/implement, frequent intentional compaction, và bốn điểm review trước khi viết code. Đây là bản tổng hợp cùng kế hoạch triển khai cụ thể.

· 7 phút đọc

Bên trong kiến trúc Multi-Agent của Claude Code: Hướng dẫn triển khai cho Tech Lead

Agent lập trình đơn (single-agent) luôn đâm vào bức tường context ngay khi task chạm tới nhiều mảng khác nhau. Câu trả lời của Claude Code là một Lead Agent điều phối các Specialist Agent qua một hệ thống task chung, với cơ chế cô lập context nghiêm ngặt — đây là cách kiến trúc này hoạt động, và một kế hoạch triển khai cụ thể để áp dụng vào công việc của team và dự án cá nhân.

· 6 phút đọc

Từ ReAct Đến Loop Engineering: Field Guide Kiến Trúc Agentic Loop Cho Tech Lead

Loop engineering không phải một kỹ thuật duy nhất — mà là một chồng pattern kiến trúc được xây từ 2022 đến giờ, mỗi lớp giải quyết một failure mode mà lớp trước để lộ ra. Đây là hành trình tiến hóa, chu trình 5 bước của loop, các guardrail bắt buộc trong production, và cách chọn đúng pattern cho team bạn.

· 6 phút đọc

DiffusionGemma-26B: 1.000 Token/Giây Có Ý Nghĩa Gì Với Developer Tooling

Google vừa open-source model text diffusion đầu tiên đáng tin cậy từ major lab — DiffusionGemma-26B generate 1.000+ token/giây bằng cách từ bỏ hoàn toàn autoregressive token generation. Đây là cách Uniform State Diffusion thực sự hoạt động, khi nào kiến trúc này quan trọng, và ý nghĩa với việc build với open-weights model.

· 16 phút đọc

Sự Tiến Hóa của AI Agentic Patterns: Từ Prompt Đến Production System

Câu hỏi trung tâm của việc xây dựng hệ thống AI đã thay đổi ba lần trong bốn năm — từ 'nói gì với model?' đến 'xây hệ thống gì?'. Deep dive về prompt engineering, context engineering, và harness engineering với architecture diagrams, decision frameworks, và production lessons cho engineering leaders.