Đăng nhậpLiên hệBắt đầu miễn phí
Cost, Billing, and Ops27 tháng 7, 2026Big Y

Giá Gemini API năm 2026: Chi phí mô hình hiện tại và công cụ tính khối lượng công việc

So sánh giá Gemini API hiện tại với các bảng chi phí khối lượng công việc có thể tái lập cho Gemini 3.6 Flash, 3.5 Flash-Lite, các mô hình Gemini 2.5, tác vụ Batch, bộ nhớ đệm và khối lượng công việc ngữ cảnh dài.

Giá Gemini API năm 2026: Chi phí mô hình hiện tại và công cụ tính khối lượng công việc

Nếu bạn đang so sánh giá Gemini API trong năm 2026, phần khó nhất không phải là tìm bảng giá. Mà là xác định bảng giá nào áp dụng cho khối lượng công việc của bạn.

Kết quả tìm kiếm thường trộn lẫn bốn sản phẩm khác nhau: Gemini Developer API, trải nghiệm thử nghiệm của Google AI Studio, Vertex AI hoặc các dịch vụ Google Cloud khác, và các gói đăng ký Gemini dành cho người dùng. Hướng dẫn này tập trung vào Gemini Developer API và sử dụng giá chính thức cùng các trang thanh toán của Google được kiểm tra vào ngày 27 tháng 7 năm 2026.

Câu trả lời ngắn gọn là chi phí Gemini API phụ thuộc vào năm biến số:

  1. dòng mô hình bạn chọn
  2. khối lượng token đầu vào và đầu ra
  3. việc các prompt riêng lẻ có vượt qua ngưỡng ngữ cảnh dài hay không
  4. việc khối lượng công việc có thể dùng định giá Batch hay không
  5. các tiện ích bổ sung như caching ngữ cảnh, grounding, âm thanh, hình ảnh hoặc video

Điều đó có nghĩa là mức giá token thấp nhất được nêu trên đầu trang không phải lúc nào cũng là chi phí sản xuất thấp nhất. So sánh hữu ích là một bảng chi phí khối lượng công việc với cùng một bộ giả định áp dụng cho mọi mô hình ứng viên.

Giá Gemini API trong nháy mắt

Bảng dưới đây tóm tắt các dòng Gemini Developer API chính có khả năng xử lý văn bản mà các nhóm thường so sánh. Giá tính bằng đô la Mỹ trên 1 triệu token, dựa trên trang giá Gemini Developer API chính thức của Google.

Mô hình Trạng thái Đầu vào tiêu chuẩn Đầu ra tiêu chuẩn Đầu vào Batch Đầu ra Batch Ghi cache ngữ cảnh Lưu trữ cache mỗi giờ
Gemini 3.6 Flash Xem trước $0.40 $2.40 $0.20 $1.20 $0.04 $1.00
Gemini 3.5 Flash Xem trước $1.50 $9.00 $0.75 $4.50 $0.15 $1.00
Gemini 3.5 Flash-Lite Xem trước $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 3.1 Flash-Lite Xem trước $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 2.5 Pro Ổn định $1.25 up to 200k; $2.50 above 200k $10.00 up to 200k; $15.00 above 200k $0.625 up to 200k; $1.25 above 200k $5.00 up to 200k; $7.50 above 200k $0.125 up to 200k; $0.25 above 200k $4.50
Gemini 2.5 Flash Ổn định $0.30 $2.50 $0.15 $1.25 $0.03 $1.00
Gemini 2.5 Flash-Lite Ổn định $0.10 $0.40 $0.05 $0.20 $0.01 $1.00

Đối với Gemini 3.6 Flash, Gemini 3.5 Flash, các mô hình xem trước Flash-Lite và các dòng Gemini 2.5 Flash, đầu vào âm thanh có mức giá cao hơn so với đầu vào văn bản, hình ảnh hoặc video. Bảng này sử dụng mức giá đầu vào cho văn bản, hình ảnh và video để các hàng mô hình vẫn có thể so sánh với nhau.

Các mô hình xem trước có thể thay đổi trước khi phát hành ổn định. Nếu chính sách sản xuất của bạn yêu cầu hành vi cố định, thời hạn ngừng hỗ trợ dài hơn hoặc mã định danh mô hình ổn định, hãy so sánh kinh tế của bản xem trước với các hàng Gemini 2.5 ổn định thay vì chỉ chọn theo giá.

Những gì đã thay đổi trong bản cập nhật ngày 27 tháng 7 năm 2026

Thay đổi quan trọng nhất kể từ phiên bản trước của hướng dẫn này là danh mục mô hình hiện tại.

  • Gemini 3.6 Flash Preview hiện xuất hiện như một tùy chọn thông lượng cao với giá $0.40 đầu vào và $2.40 đầu ra cho mỗi triệu token.
  • Gemini 3.5 Flash-Lite Preview hiện xuất hiện ở mức $0.25 đầu vào và $1.50 đầu ra cho mỗi triệu token.
  • Dòng Gemini 3.1 Flash-Lite trước đó vẫn còn hiển thị, nhưng người mua nên xác nhận họ dự định vận hành định danh mô hình preview nào.
  • Các mô hình ổn định Gemini 2.5 vẫn là mốc so sánh hữu ích cho các nhóm coi trọng tính dự đoán của vòng đời sản phẩm.

Đó là lý do một trang giá Gemini cần được bảo trì theo lịch. Một bảng chính xác vẫn có thể trở nên gây hiểu nhầm một cách chiến lược ngay cả khi mọi con số cũ vẫn còn hiện diện ở đâu đó trong danh mục.

Bảng chi phí khối lượng công việc Gemini API

Bảng dưới đây chuyển đổi mức giá thành ước tính ngân sách. Các kịch bản này không phải là chuẩn đánh giá chất lượng, và các mô hình không thể thay thế cho nhau. Chúng trả lời một câu hỏi tài chính hẹp hơn: hóa đơn token sẽ là bao nhiêu nếu cùng một khối lượng công việc chạy trên từng tuyến?

Giả định

Khối lượng công việc Khối lượng yêu cầu Đầu vào mỗi yêu cầu Đầu ra mỗi yêu cầu Tổng đầu vào Tổng đầu ra
Phân loại và trích xuất 1.000 yêu cầu 2.000 token 300 token 2M token 0,3M token
Trợ lý tăng cường truy xuất 1.000 yêu cầu 20.000 token 1.000 token 20M token 1M token
Đánh giá tài liệu dài 100 yêu cầu 150.000 token 5.000 token 15M token 0,5M token

Kịch bản tài liệu dài giữ mỗi prompt thấp hơn ngưỡng 200k của Gemini 2.5 Pro. Các yếu tố grounding, caching, âm thanh, tạo hình ảnh và tạo video đều bị loại trừ.

Ước tính chi phí token theo tầng Standard

Mô hình Phân loại Trợ lý RAG Đánh giá tài liệu dài
Gemini 3.5 Flash-Lite $0.95 $6.50 $4.50
Gemini 3.6 Flash $1.52 $10.40 $7.20
Gemini 2.5 Flash-Lite $0.32 $2.40 $1.70
Gemini 2.5 Flash $1.35 $8.50 $5.75
Gemini 3.5 Flash $5.70 $39.00 $27.00
Gemini 2.5 Pro $5.50 $35.00 $23.75

Các tổng này cho thấy vì sao một bảng khối lượng công việc hữu ích hơn một danh sách mô hình.

  • Đối với trích xuất hẹp, hàng Gemini 2.5 Flash-Lite ổn định có chi phí token thấp nhất trong so sánh này.
  • Gemini 3.6 Flash tốn nhiều hơn các tuyến Lite nhưng thấp hơn đáng kể so với Gemini 3.5 Flash dưới cùng các giả định.
  • Trong ví dụ tài liệu dài, hóa đơn token của Gemini 2.5 Pro thấp hơn Gemini 3.5 Flash vì prompt vẫn nằm dưới ngưỡng của Pro. Điều đó không chứng minh đây là mô hình tốt hơn, nhưng ngăn chặn giả định sai lệch rằng mọi khối lượng công việc Pro đều phải tốn nhiều hơn.
  • Các ứng dụng thiên về đầu ra nhạy cảm hơn với lựa chọn mô hình vì token đầu ra có giá cao hơn token đầu vào văn bản trên mọi hàng được hiển thị ở đây.

Batch pricing tác động như thế nào đến cùng các khối lượng công việc

Đối với các hàng hỗ trợ Batch API, mức giá token Batch mà Google công bố thường bằng một nửa mức Standard. Nếu mọi yêu cầu trong các kịch bản trên đều có thể chạy bất đồng bộ, tổng token ước tính sẽ là:

Mô hình Phân loại với Batch Trợ lý RAG với Batch Rà soát tài liệu dài với Batch
Gemini 3.5 Flash-Lite $0.475 $3.25 $2.25
Gemini 3.6 Flash $0.76 $5.20 $3.60
Gemini 2.5 Flash-Lite $0.16 $1.20 $0.85
Gemini 2.5 Flash $0.675 $4.25 $2.875
Gemini 3.5 Flash $2.85 $19.50 $13.50
Gemini 2.5 Pro $2.75 $17.50 $11.875

Batch là một quyết định về thanh toán và kiến trúc. Đây là lựa chọn phù hợp cho enrichment ngoại tuyến, các lượt chạy đánh giá, bản tóm tắt ban đêm, backfill tài liệu và các công việc khác không yêu cầu phản hồi ngay lập tức. Nó không phải là giải pháp thay thế cho dịch vụ Standard khi người dùng đang chờ trong một luồng sản phẩm tương tác.

Công thức đằng sau chi phí Gemini API

Đối với một khối lượng công việc văn bản không có tiện ích bổ sung, hãy dùng:

monthly cost =
  (input tokens / 1,000,000 × input rate)
  + (output tokens / 1,000,000 × output rate)

Nếu ứng dụng sử dụng context caching, hãy cộng thêm chi phí ghi cache và lưu trữ. Nếu ứng dụng sử dụng grounding, âm thanh, hình ảnh được tạo hoặc video được tạo, hãy tính riêng các khoản đó vì chúng không dùng chung một mức giá token duy nhất.

Đối với các bài đánh giá tài chính, hãy ghi lại các giả định bên cạnh kết quả:

Giả định cần ghi lại Vì sao quan trọng
Số yêu cầu mỗi tháng Chuyển hành vi theo từng yêu cầu thành ngân sách
Số token đầu vào trung bình và p95 Prompt dài có thể kích hoạt mức giá Pro cao hơn
Số token đầu ra trung bình và p95 Đầu ra thường là phần tốn kém hơn
Tỷ trọng Standard so với Batch Công việc bất đồng bộ có thể giảm đáng kể chi tiêu token
Khối lượng ghi cache và thời gian lưu giữ Tái sử dụng có thể tiết kiệm chi phí đầu vào nhưng lưu trữ không miễn phí
Các yêu cầu có grounding Google Search và Maps có mức phân bổ và phí riêng
Đơn vị âm thanh, hình ảnh và video Định giá theo phương thức có thể chiếm phần lớn hóa đơn token văn bản

Bậc miễn phí so với bậc trả phí của Gemini API

Google hiển thị bậc miễn phí cho một số mô hình Gemini Developer API hiện tại. Điều đó khiến nó hữu ích cho thử nghiệm, tạo nguyên mẫu và xác thực ở quy mô thấp. Tuy nhiên, nó không làm mất đi câu hỏi về chi phí khi triển khai sản phẩm.

Tài liệu thanh toán của Gemini API billing documentation tách biệt mức sử dụng miễn phí và trả phí, đồng thời giải thích cách các dự án chuyển sang bậc trả phí. Các nhóm nên xác nhận điều kiện đủ điều kiện hiện tại, giới hạn tốc độ, điều khoản sử dụng dữ liệu và tính khả dụng của mô hình trước khi coi một nguyên mẫu thành công ở bậc miễn phí là bằng chứng cho môi trường production.

Phân biệt thực tế là:

  • Sử dụng gói miễn phí để thử nghiệm prompt, hành vi SDK và mức độ phù hợp của sản phẩm.
  • Sử dụng mức giá của gói trả phí và dữ liệu token thực tế để phê duyệt ngân sách sản xuất.
  • Đừng giả định rằng một mô hình preview, hạn mức miễn phí hoặc giới hạn tốc độ sẽ không thay đổi trước khi ra mắt.

Giá Gemini Pro và ngưỡng 200k token

Gemini 2.5 Pro có một trong những ngưỡng định giá quan trọng nhất trong bảng hiện tại. Các prompt lên đến 200k token sẽ áp dụng mức giá đầu vào và đầu ra thấp hơn. Các prompt trên 200k sẽ áp dụng mức giá cao hơn.

Ngưỡng đó áp dụng cho kích thước prompt của từng yêu cầu riêng lẻ, không phải tổng theo tháng. Một nhóm gửi 20 triệu token trong nhiều prompt nhỏ vẫn có thể duy trì mức giá thấp hơn, trong khi một ứng dụng ngữ cảnh dài có khối lượng thấp hơn có thể vượt qua ngưỡng này nhiều lần.

Theo dõi ít nhất hai chỉ số sau:

  1. tỷ lệ yêu cầu có hơn 200k token đầu vào
  2. phần chi phí do các yêu cầu đó đóng góp

Nếu một phần nhỏ prompt quá lớn lại tạo ra phần lớn chi phí, hãy cân nhắc chia nhỏ, truy xuất, tóm tắt, tái sử dụng cache hoặc một chính sách định tuyến chỉ dành mô hình ngữ cảnh dài cho các yêu cầu thực sự cần nó.

Chi phí context caching, grounding và đa phương thức

Tỷ lệ token chỉ là lớp nền tảng của giá Gemini API.

Bộ nhớ đệm ngữ cảnh

Bảng chính thức liệt kê một mức giá ghi cache và một mức giá lưu trữ theo giờ. Caching có thể cải thiện hiệu quả kinh tế khi cùng một ngữ cảnh lớn được tái sử dụng đủ số lần, nhưng điểm hòa vốn phụ thuộc vào khối lượng ghi, thời gian lưu giữ và lượng đầu vào lặp lại mà cache thay thế.

Grounding với Google Search và Maps

Grounding bao gồm các hạn mức miễn phí theo từng mô hình, sau đó là phí tính theo truy vấn hoặc theo prompt. Đừng ước tính một ứng dụng có grounding chỉ dựa trên tỷ lệ token. Hãy ghi lại số lượng yêu cầu có grounding và đối soát chúng như một hạng mục riêng.

Âm thanh trực tiếp

Âm thanh của Live API sử dụng tỷ lệ đầu vào và đầu ra khác với các lệnh gọi văn bản thông thường. Các nhóm xây dựng tác tử thoại nên lập ngân sách token âm thanh riêng và đưa thời lượng phiên, hành vi ngắt quãng và độ dài phản hồi vào các bài kiểm thử tải.

Tạo ảnh và video

Ảnh và video được tạo ra được định giá bằng các đơn vị và hàng mô hình dành riêng cho từng phương thức. Hãy xem chúng như các ngân sách sản xuất riêng biệt, không phải phần mở rộng của ước tính cho mô hình văn bản.

Gemini Developer API so với Vertex AI và các gói dành cho người dùng

Cụm từ "Giá Gemini" có thể chỉ nhiều đường mua khác nhau.

Sản phẩm Câu hỏi điển hình của người mua Vì sao không nên gộp vào bảng này
Gemini Developer API Các lệnh gọi ứng dụng sẽ tốn bao nhiêu? Đây là bảng giá được tóm tắt trong hướng dẫn này
Google AI Studio Tôi có thể tạo mẫu thử và lấy khóa API không? Đây là bề mặt phát triển, không phải một bảng giá sản xuất chung riêng biệt
Vertex AI Tôi vận hành Gemini bên trong Google Cloud như thế nào? Các điều khoản thương mại, kiểm soát và tùy chọn dịch vụ có thể khác nhau
Các gói Gemini dành cho người dùng Một gói thuê bao cá nhân bao gồm những gì? Giá thuê bao không phải là giá token của API
Gemini Enterprise hoặc Agent Platform Một sản phẩm doanh nghiệp rộng hơn có giá bao nhiêu? Phạm vi sản phẩm này khác với các lệnh gọi Developer API

Khi so sánh các nhà cung cấp hoặc gateway, hãy giữ nguyên cùng một lộ trình mua hàng ở cả hai phía. Việc so sánh gói đăng ký dành cho người tiêu dùng với token API, hoặc một dịch vụ đám mây được quản lý với API dành cho nhà phát triển, sẽ tạo ra một kết luận trông có vẻ gọn gàng nhưng không thể sử dụng được.

Khi truy cập trực tiếp Google là đủ

Truy cập Gemini trực tiếp thường là lựa chọn đơn giản nhất khi:

  • Gemini là họ mô hình duy nhất đang chạy trong môi trường production.
  • Nhóm cảm thấy thoải mái với cách lập hóa đơn và cấu trúc tài khoản của Google.
  • Đội ngũ kỹ thuật không cần cơ chế dự phòng đa nhà cung cấp hoặc trừu tượng hóa tuyến маршру.
  • Bộ phận tài chính có thể xem xét mức sử dụng mà không cần hợp nhất với các nhà cung cấp AI khác.

Một AI API gateway trở nên hữu ích hơn khi vấn đề vận hành mở rộng vượt ra ngoài một nhà cung cấp:

  • sản phẩm sử dụng Gemini, GPT, Claude hoặc các họ mô hình khác
  • đội ngũ kỹ thuật muốn có một bề mặt thông tin xác thực và định tuyến mô hình tập trung
  • bộ phận tài chính muốn có số dư, hóa đơn hoặc rà soát mức sử dụng được hợp nhất
  • vận hành cần đo đếm ở cấp độ mô hình và các điều khiển chính sách dùng chung
  • các nhóm muốn thay đổi tuyến mà không phải xây dựng lại mọi tích hợp

Gateway không loại bỏ nhu cầu hiểu giá của các mô hình nền tảng. Nó thay đổi cách truy cập, định tuyến, mua sắm và báo cáo được quản lý xung quanh những mức giá đó.

Flatkey cung cấp một lớp truy cập API duy nhất cho nhiều họ mô hình. Hãy xem trang giá Flatkey hiện tại để biết mô hình thương mại, sau đó so sánh bức tranh mô hình rộng hơn trong so sánh giá mô hình AI.

Danh sách kiểm tra cập nhật giá Gemini định kỳ

Các trang giá nên có một người phụ trách rà soát nguồn được chỉ định và một khung thời gian cập nhật định kỳ. Với một truy vấn có nhu cầu cao như Gemini API pricing, rà soát hàng tháng là mặc định hợp lý, kèm theo rà soát ngay sau các thông báo lớn về mô hình của Google.

Hãy dùng danh sách kiểm tra này:

  1. So sánh thứ tự mô hình và các nhãn vòng đời trên trang giá chính thức của Google.
  2. Ghi lại các mã định danh mô hình preview, stable, deprecated và removed mới.
  3. Xác minh riêng các mức giá Standard, Batch, cache-write và cache-storage.
  4. Kiểm tra lại các ngưỡng độ dài prompt và xem chúng có ảnh hưởng đến đầu vào, đầu ra hay cả hai hay không.
  5. Xác minh khả năng có gói miễn phí và ngôn ngữ về bậc thanh toán.
  6. Tính toán lại mọi ví dụ khối lượng công việc dựa trên các giả định đã công bố.
  7. Kiểm tra các phần grounding, Live API, hình ảnh và video để xem có thay đổi giá riêng hay không.
  8. Xác nhận các liên kết nội bộ, tuyên bố sản phẩm và CTA giá công khai vẫn chính xác.
  9. Cập nhật ngày hiển thị "đã kiểm tra vào" chỉ sau khi hoàn tất rà soát nguồn.

Mục tiêu không phải là hứa rằng một bài viết về giá sẽ không bao giờ lỗi thời. Mục tiêu là làm cho mọi con số đều có thể truy vết, mọi kịch bản đều có thể tái tạo, và mọi lần cập nhật đều đủ nhanh để trang vẫn hữu ích.

Quyết định mua hàng

Bắt đầu từ hình dạng khối lượng công việc, không phải tên mô hình.

  • Chọn tuyến có chi phí thấp nhất nhưng vẫn đáp ứng yêu cầu về chất lượng và độ trễ của tác vụ.
  • Dùng Batch cho các công việc không đồng bộ đủ điều kiện.
  • Theo dõi token đầu ra và các điểm gãy của ngữ cảnh dài.
  • Dự trù riêng cho caching, grounding, audio, image và video.
  • Xem lại kiến trúc truy cập khi Gemini không còn là nhà cung cấp duy nhất trong ngăn xếp.

Quy trình đó biến giá Gemini API từ một bảng tĩnh thành một quyết định vận hành có thể lặp lại.