Hook
Đã thấy mùi — theo dõi chặt. Amazon vừa ra chỉ thị nội bộ: AWS engineers phải cắt giảm lãng phí CPU ngay lập tức. Không phải đề xuất. Không phải khuyến nghị. Là mệnh lệnh trực tiếp từ tầng quản trị cao nhất.
Nguồn tin từ Crypto Briefing — không phải AWS blog, không phải The Information, không phải CNBC. Một tín hiệu rò rỉ từ bên trong gã khổng lồ chiếm 30% thị phần cloud toàn cầu. Thông tin này nếu đúng, đang vẽ lại toàn bộ bản đồ cung ứng điện toán thế giới. Nếu sai? Chúng ta đang phân tích trên một tín hiệu nhiễu — nhưng ngay cả nhiễu cũng phản ánh tần số của thị trường.
Tôi đã theo dõi dòng tiền on-chain suốt 8 năm qua. Tôi biết mùi của sự khan hiếm. Mùi này khác.
Context
Đặt bối cảnh: 2023-2024, AI đã nuốt chửng mọi nguồn lực tính toán. GPU trở thành vàng kỹ thuật số — nhưng điều mọi người quên là AI không chỉ cần GPU. Mỗi mô hình huấn luyện cần một đội quân CPU đứng sau: xử lý dữ liệu, điều phối tác vụ, service discovery, load balancing... CPU là hạ tầng ngầm của toàn bộ cuộc cách mạng AI.
AWS chưa bao giờ thiếu capacity trong lịch sử 18 năm của mình. "Infinite scale" — quy mô vô hạn — không chỉ là slogan marketing, nó là cam kết hợp đồng ngầm với hàng triệu doanh nghiệp trên thế giới. Họ xây dựng cả một đế chế trên lời hứa: bạn cần bao nhiêu, chúng tôi có bấy nhiêu, ngay lập tức.
Giờ thì ngay cả AWS cũng phải nhìn vào khoảng trống giữa "những gì đã hứa" và "những gì có thể cung cấp".
Yield farming cũ — bài học mới. Năm 2020, tôi đổ 2 ETH vào pool thanh khoản SushiSwap, mất 80% vốn vì tôi không đọc kỹ cơ chế impermanent loss. Bài học có hệ thống: khi một giao thức bắt đầu thay đổi luật chơi nội bộ, những người nhỏ lẻ luôn là người trả giá cuối cùng.
Core
AWS ra lệnh "cắt giảm lãng phí CPU" — ba chữ đó chứa đựng nhiều tín hiệu hơn toàn bộ báo cáo tài chính quý của Amazon. Hãy giải mã từng lớp:
Lớp 1: Đây là bài toán về nguồn cung, không phải hiệu quả vận hành. AWS nổi tiếng với hệ thống lập lịch tài nguyên (resource scheduler) được mệnh danh là tốt nhất ngành. Nếu họ phải ra lệnh "tiết kiệm", nghĩa là thuật toán đã đạt đến ngưỡng vật lý. Ngưỡng này không nằm ở phần mềm — nằm ở chip và điện. Đơn hàng chip toàn cầu đang bị đứt gãy chuỗi cung ứng. Power quota cho trung tâm dữ liệu không thể tăng lên chỉ bằng một cú bấm nút.
Lớp 2: Người chịu thiệt đầu tiên — khách hàng nhỏ và startup. Trong kinh tế tài nguyên khan hiếm, người có hợp đồng lớn được ưu tiên. Doanh nghiệp lớn có enterprise agreement bảo vệ capacity. Nhưng startup Việt Nam, công ty indie đang chạy AI inference trên EC2? Họ sẽ cảm nhận độ trễ trước tiên. Hãy nhìn kỹ cái giá phải trả khi "vô hạn" không còn là mặc định: giá Spot instance có thể tăng vọt, các instance type thông dụng như m5.large, t3.medium sẽ xuất hiện tình trạng "InsufficientInstanceCapacity" — lỗi mà trước đây chỉ gặp ở GPU instance.
Lớp 3: Điểm chuyển đổi mô hình kinh doanh. "Cắt giảm lãng phí" đồng nghĩa với việc AWS sẽ siết chặt các chương trình khuyến mãi, giảm tần suất discount, đẩy mạnh bán "Savings Plans" với cam kết dài hạn. Nói đơn giản: họ muốn biến khách hàng dùng theo nhu cầu thành khách hàng cam kết theo hợp đồng. Doanh thu ổn định hơn, nhưng tính linh hoạt của thị trường bị giảm. Đây là một quá trình ép khách từ "trả tiền theo giờ sử dụng" sang "trả tiền theo cam kết sử dụng" — thay đổi DNA cạnh tranh vốn có của AWS.
Lớp 4: Đây là cú huých vô tình cho competitors. Microsoft Azure sở hữu OpenAI — có nguồn GPU riêng khổng lồ. Google Cloud có TPU — đã đầu tư từ năm 2015. Còn các chuyên gia AI cloud như CoreWeave, Lambda Labs thì hưởng lợi trực tiếp từ dòng khách chuyển đi. Nếu AWS bước vào kỷ nguyên "capacity rượt đuổi demand", điều này mở ra một cánh cửa cạnh tranh chưa từng có cho Azure, Google Cloud và các nhà cung cấp chuyên biệt.
Nhưng tôi đã học được điều gì đó từ 4 năm quan sát on-chain: người ta phải chịu đòn đau trước khi đổi hướng. Người dùng AWS nếu bị chậm trễ khi khởi tạo instance ở us-east-1 (region lớn nhất thế giới của AWS), sẽ cân nhắc chạy đa cloud. Bằng chứng ở chỗ: "multi-cloud strategy" đang chuyển từ câu nói sáo rỗng thành hành động cụ thể trong báo cáo kiến trúc doanh nghiệp. Khi một doanh nghiệp bắt đầu đặt workload phụ ở Azure chẳng hạn, con dao "exit cost" sẽ bớt sắc hơn. Một khi đã cắm rễ ở đất mới, họ sẽ nghĩ đến chuyện chuyển nhiều workload hơn.
Đã từng có một biến động tương tự trong quá khứ, vào năm 2020, khi giá EC2 tăng vọt do nhu cầu đột biến từ COVID. Lúc đó AWS xử lý bằng cách tung ra các đợt discount và tăng cường công suất — họ có vòng đời kiến trúc đủ dài để "nuốt" cú sốc. Nhưng lần này thì khác. Cú sốc "AI demand" không phải đợt sóng rồi sẽ rút. Nó là con thủy triều mới, có tính dài hạn và cấu trúc.
Contrarian Angle
Góc nhìn ngược — mọi người đang bàn về "khan hiếm tài nguyên". Nhưng hãy nhìn từ một hướng khác: đây có thể là một màn dàn dựng chiến lược để đẩy mạnh doanh thu từ các sản phẩm AI mới đắt tiền.
AWS muốn khách hàng chuyển từ mua CPU rẻ sang mua GPU đắt tiền? Không. Họ đã có sẵn nhu cầu GPU khổng lồ từ Anthropic, từ các startup AI. Vấn đề thật sự là: AWS muốn khách hàng doanh nghiệp truyền thống ký hợp đồng lớn hơn, dài hạn hơn, để họ có cơ sở vay vốn đầu tư thêm hạ tầng. Chiến lược "ép buộc" kiểu này từng được sử dụng bởi các công ty viễn thông Trung Quốc trong thời kỳ 4G — tạo ra cảm giác khan hiếm để đẩy nhanh quyết định mua.
Một điểm khác đáng suy ngẫm: cú "ép buộc" này có thể là công cụ tinh gọn danh mục sản phẩm. AWS là nơi có hàng trăm loại instance type khác nhau. "Cắt giảm lãng phí CPU" có thể là cái cớ hợp lý để loại bỏ những instance type lỗi thời, tập trung vào thế hệ Graviton mới và Trainium. Nhưng hệ quả là các khách hàng đang chạy trên instance cũ — như m4, m5 trước đây — sẽ phải "bị ép" nâng cấp lên loại instance mới hơn, đắt hơn.
Và một điểm nữa, thú vị hơn: cái mùa "khan hiếm CPU" này có thể là mùa gặt hái cho những ai chuẩn bị sẵn sàng. Nhà phát triển phần mềm nào tối ưu hóa mã nguồn, giảm CPU cycle, sẽ chạy nhanh hơn và rẻ hơn trong lúc thị trường đang sốt. Đây là lúc chất lượng kỹ thuật tạo ra lợi thế cạnh tranh rõ ràng nhất. Trong khi đám đông đổ xô mua thêm capacity, người thông minh sẽ tối ưu code.
Takeaway
Theo dõi sát AWS re:Invent 2024. Nếu Amazon công bố Trainium2 với cam kết "không giới hạn dung lượng", điều đó xác nhận họ đang né tránh các hạn chế của chip bên ngoài. Nếu họ có phát ngôn về "sustainable computing" hoặc "right-sizing" trong bài phát biểu chính, hãy coi đó là sự chuẩn bị tinh thần cho khách hàng về một bình thường mới: khả năng không còn là vô hạn.
Trong thị trường crypto, chúng ta đã học được điều này: khi cầu vượt cung, giá sẽ phản ánh sự khan hiếm — nhưng phản ứng chậm có thể khiến các trader nhỏ lẻ bị bỏ lại phía sau. "NFT floor đang rung — ai đang mua?" — cùng một logic ở đây: khi CPU đang khan hiếm, ai đang nắm capacity?
Điều duy nhất chắc chắn: khả năng không còn là vô hạn. Và khi tài nguyên khan hiếm, những ai nắm giữ tài nguyên sẽ nắm giữ quyền lực. Còn những ai phụ thuộc — họ cần chuẩn bị kế hoạch B ngay từ bây giờ, trước khi cơn bão đổ bộ.
Trong bối cảnh thị trường giảm giá, tôi chỉ đưa ra một phán đoán an toàn: hãy giữ cho hệ thống của bạn gọn nhẹ, tối ưu, và không phụ thuộc vào một nguồn duy nhất. Bài học yield farming năm 2020 đã dạy tôi điều đó với chi phí 80% vốn. Bây giờ tôi không muốn nhìn ai đó phải trả chi phí tương tự để học lại bài học này.