25 Tháng 7, 2026
Bài 6 — Context và token: vì sao phiên chat càng dài máy càng lú, và cách giữ nó luôn tỉnh

🎓 Khoá học miễn phí: Claude Code cơ bản — bài 6/10. Toàn bộ khoá nằm trong chuyên mục Khoá học AI miễn phí của MONA.
Học xong bài này, anh chị hiểu “bộ nhớ ngắn hạn” của AI vận hành ra sao, tự soi được tiền token của mình đang chảy đi đâu bằng một lệnh, và nắm bộ thói quen giúp máy vừa khôn hơn vừa rẻ hơn. Nghe kỹ thuật, nhưng đây thật ra là bài về quản chi phí và chất lượng, đúng nghề của người làm kinh doanh.
Context window: cái bàn làm việc của máy
Mỗi model AI có một context window: tổng lượng chữ (tính bằng token) nó “ôm” được trong đầu cùng một lúc, ví dụ cỡ 200.000 token với model lớn. Hãy hình dung nó như mặt bàn làm việc: bàn rộng cỡ nào thì cũng chỉ bày được chừng đó giấy tờ. Phiên chat càng kéo dài, giấy tờ chất càng cao, và cũng như người thật, bàn càng bừa thì làm việc càng lú. Chất lượng trả lời giảm dần khi context đầy lên, đó là đặc tính của mọi model hiện nay.
Điều ít ai biết: ngay khi anh chị mở phiên mới, chưa gõ chữ nào, bàn đã có sẵn vài chục nghìn token giấy tờ. Gõ lệnh /context mà xem, nó liệt kê rành mạch ai đang chiếm chỗ:
- System prompt: các tầng CLAUDE.md + rules + memory của anh chị (bài 4), được nạp vào đầu mọi phiên.
- System tools: mô tả bộ đồ nghề có sẵn của máy (đọc file, sửa file, chạy lệnh, tìm kiếm web, lập kế hoạch…), ngốn cỡ 15-17 nghìn token và anh chị không cắt được.
- MCP tools: đồ nghề ngoài do chính anh chị cắm thêm (bài 8). Phần này anh chị kiểm soát được, và cũng là phần dễ phình nhất.
- Messages: phần trao đổi thật giữa anh chị và máy.
- Free space: chỗ trống còn lại.

Vì sao phải quan tâm? Vì anh chị trả tiền cho mọi token trên bàn, kể cả phần bị nạp ngầm. Một CLAUDE.md nhồi 10.000 token bị tính lại mỗi lần mở phiên. Một MCP tạp nham có thể nuốt 20% mặt bàn ngay khi cắm vào. Token là tiền, và bàn chật còn làm máy trả lời dở đi: thiệt đơn thiệt kép.
Compact và clear: dọn bàn đúng lúc
Hai lệnh dọn dẹp cần thuộc lòng:
/compact: nén toàn bộ lịch sử trò chuyện thành một bản tóm tắt mật độ cao, giải phóng mặt bàn mà vẫn giữ ý chính. Máy cũng tự làm việc này khi bàn gần đầy (autocompact), nhưng chủ động nén ở điểm mình chọn thì kiểm soát tốt hơn. Mẹo hay: nén kèm chỉ dẫn, kiểu “/compact ưu tiên giữ lại các quyết định về thiết kế và danh sách việc chưa xong”.
/clear: xoá sạch, bàn trắng tinh. Dùng khi chuyển sang việc không liên quan. Đây là thói quen người mới hay bỏ qua nhất: xong việc A, tiện tay hỏi luôn việc B trong cùng phiên, để rồi việc B bị nhiễu bởi cả núi bối cảnh việc A. Việc mới, phiên mới. Cứ nhớ: mở phiên mới không mất gì cả, vì mọi thứ đáng nhớ đã nằm trong CLAUDE.md.
Một mẹo cho người thích nhìn đồng hồ: lệnh /statusline cho anh chị tuỳ biến dòng trạng thái dưới màn hình terminal, ví dụ gắn thanh phần trăm token đã dùng, nhìn phát biết ngay sắp phải dọn bàn chưa. (Bản terminal mới chỉnh được món này, bản giao diện đồ hoạ thì không, thêm một lý do để theo terminal.)
Chọn model và chỉnh mức suy nghĩ
Lệnh /model cho đổi “bộ não” giữa các cỡ: model lớn (Opus) khôn nhất nhưng đắt nhất, model vừa (Sonnet) và nhỏ (Haiku) rẻ hơn nhiều. Nguyên tắc chi tiêu y như phân việc trong công ty: việc khó đưa người giỏi, việc lặt vặt đừng bắt giám đốc làm. Đến bài 9 anh chị sẽ thấy nguyên tắc này thành hệ thống: agent con dùng model rẻ cày phần nặng, chỉ trả bản tóm tắt về cho agent mẹ dùng model xịn.
Cũng trong /model có mục thinking: bật thì máy được “nháp” trong một vùng suy nghĩ riêng trước khi trả lời. Điểm hay: vùng nháp đó không cộng dồn vào lịch sử trò chuyện (dù vẫn tính tiền lúc chạy), nên câu trả lời cuối gọn mà vẫn sâu. Với việc cần suy luận nhiều, bật thinking rồi dặn máy “trả lời ngắn thôi, cần thì tao hỏi thêm” là combo tiết kiệm bàn rất hiệu quả.
Bộ thói quen giữ máy khôn và hoá đơn nhẹ
Gom các nguyên tắc chính hãng khuyên + kinh nghiệm tụi em xài hằng ngày:
- Ra lệnh cụ thể thay vì mông lung. “Sửa lỗi hiển thị giá ở trang thanh toán, file checkout” ăn đứt “cải thiện cái web này giùm tao”. Lệnh càng trúng đích, máy càng ít lang thang, token càng ít cháy. Đây là mẹo lời nhất mà không tốn gì.
- Giữ CLAUDE.md gọn (200-500 dòng, bài 4), thứ gì là “việc” chứ không phải “luật” thì chuyển thành skill, vì skill chỉ được nạp khi gọi tới (bài 7).
- Kén chọn MCP. Trước khi cắm đồ nghề ngoài, coi nó chiếm bao nhiêu chỗ bằng /context. Đồ không dùng thì tháo.
- Việc mới, phiên mới. /clear là bạn thân.
- Nén chủ động ở các điểm nghỉ tự nhiên của công việc, kèm chỉ dẫn giữ gì.
- Cần xả ý dài bằng giọng nói? Xả vào một phiên model rẻ trước, nhờ nó nén thành đề bài gọn, rồi mới đưa đề bài đó cho model xịn. Đừng đổ nguyên tràng “ừm, à” vào phiên đắt tiền.

Anh chị để ý sẽ thấy toàn bộ bài này quy về một câu quen thuộc trong quản trị: đừng bắt một người ôm quá nhiều việc cùng lúc rồi trách họ làm ẩu. Máy cũng vậy. Người quản lý giỏi chia việc, chia bối cảnh, chia người. Bài 7 và bài 9 chính là học cách “chia người” cho AI.
Tự tay làm trước khi qua bài 7
- Mở phiên mới, gõ /context, đọc bảng kê và trả lời: phần nào đang chiếm nhiều nhất, có cắt được không?
- Làm một việc dài hơi rồi thử /compact kèm chỉ dẫn, so sánh trước sau bằng /context.
- Gõ /model, coi model đang dùng, thử đổi mức thinking.
- Đặt cho mình luật “việc mới phiên mới” trong một tuần, cảm nhận khác biệt.
Bài 7 học skills: cách đóng gói một quy trình nghiệp vụ (kiểu “quét đơn hàng tồn”, “soạn email chào khách mới”) thành file dạy máy làm đi làm lại được, nói một câu là nó tự biết đường chạy, y như bàn giao SOP cho nhân viên.
Bài viết liên quan
Dịch vụ thiết kế
website chuyên nghiệp
Sở hữu website với giao diện đẹp, độc quyền 100%, bảo hành trọn đời với khả năng
mở rộng tính năng linh hoạt theo sự phát triển doanh nghiệp ngay hôm nay!

























Khoá học AI miễn phí
Công cụ AI trong công việc
VI
EN


