Tổng quan Self-hosted models
Self-hosted models cho phép tenant deploy và vận hành model phía sau một endpoint tương thích OpenAI — bốn giá trị dưới đây xuất hiện xuyên suốt flow.
Mental model
Phần tiêu đề “Mental model”| Term | Ý nghĩa | Dùng ở đâu |
|---|---|---|
| Self-hosted models | Khu vực sản phẩm trong Console để deploy và vận hành model | Navigation và documentation |
| Model | Resource bạn deploy: một model source được gắn với compute và serving configuration | Status, Chỉnh sửa (Edit), Dừng (Stop), Khởi động lại (Restart) và Xóa (Delete) |
| Endpoint | Tenant-level address hiển thị trên detail page của model | base_url của client sau khi nối /v1 |
| Served Model Name | Tên chính xác mà model đó expose cho client | Field model trong request body |
Endpoint là một address, không phải bản thân model. Nhiều model trong cùng tenant có thể hiển thị cùng endpoint; giá trị model trong request sẽ route tới Served Model Name. Khi một model đã Stop hoặc vẫn đang provision, việc detail page hiển thị tenant endpoint chưa đủ để kết luận Served Model Name có callable hay không; một model khác đã ready và dùng cùng name vẫn có thể serve request.
Chọn Platform models hay self-hosted models?
Phần tiêu đề “Chọn Platform models hay self-hosted models?”| Platform models | Self-hosted models | |
|---|---|---|
| Bên vận hành model | OneNexus | Tenant của bạn qua Console |
| Workspace và GPU quota | Không cần để gửi request | Cần để deploy và chạy model |
| API key được recommend | Platform | Inference authorize Served Model Name của model đã chọn; Platform key không gọi được model của tenant |
| Địa chỉ | Catalog endpoint dùng chung | Tenant endpoint hiển thị trên detail page của model |
Giá trị model | Giá trị model chính xác trong cURL request của dòng đã mở rộng | Served Model Name |
Dùng Platform quickstart nếu bạn chỉ cần response đầu tiên từ model đã host sẵn. Tiếp tục ở đây khi cần self-host một public Hugging Face model hoặc một finalized model version trong registry của bạn.
Prerequisites
Phần tiêu đề “Prerequisites”Trước khi mở Triển khai mô hình (Deploy model), hãy xác nhận:
- Bạn đăng nhập được vào OneNexus Console và đã chọn đúng tenant.
- Header đang hiển thị region cần deploy. Workspace và GPU quota có scope theo region.
- Tenant đã có workspace. Nếu trang Self-hosted models hiển thị Thiết lập workspace, hãy tạo workspace trước.
- Hạn mức (
Quotas) có Inference GPU allocation trong region đã chọn. Nếu chưa có, các GPU-backed action như Deploy, Chỉnh sửa (Edit), Dừng (Stop) và Khởi động lại (Restart) sẽ ở trạng thái read-only; Xóa (Delete) vẫn khả dụng để giải phóng capacity đang có. - Bạn có một model source được hỗ trợ:
- public Hugging Face repository theo dạng
owner/name; hoặc - finalized, servable model version trong Mô hình (
Models).
- public Hugging Face repository theo dạng
- Role của bạn có quyền deploy model và tạo API key.
Region trên header quyết định workspace và quota được tính. Kiểm tra nó trước tiên — cùng một tenant ở region khác sẽ có capacity khác.
Nếu thiếu workspace hoặc quota, dùng action Console hiển thị và hoàn tất onboarding hand-off trước khi tiếp tục. Không mượn workspace hoặc key của tenant khác.
Flow deploy đầu tiên
Phần tiêu đề “Flow deploy đầu tiên”Theo thứ tự:
- Triển khai model đầu tiên — chọn source, Served Model Name, Flavor và replica count, rồi đợi
Running. - Gọi endpoint — tạo Inference key và xác minh một response thật.
- Vận hành model — scale, edit, observe, stop, restart và cleanup an toàn.
- Khắc phục sự cố self-hosted model — chẩn đoán lỗi provisioning và request mà không phỏng đoán.
Readiness gate luôn giống nhau: chỉ tích hợp client khi model ở trạng thái Running, trang chi tiết có endpoint và Sao chép cURL hiển thị request đầy đủ.
Boundary hiện tại
Phần tiêu đề “Boundary hiện tại”- Mỗi self-hosted model serve đúng model source đã chọn lúc tạo. Chỉnh sửa (
Edit) không thay binding đó; hãy deploy một model khác để serve model khác. - Flow Mô hình mở (
Open model) nhận public Hugging Face repository; private hoặc gated repository không thuộc flow được document này. - Console expose replica count cụ thể. Muốn đưa model offline cần dùng Dừng (
Stop); không giả định có traffic-driven autoscaling hoặc automatic scale-to-zero. - Serving configuration và request option được hỗ trợ có thể khác theo model recipe. Bắt đầu bằng generated cURL trước khi thêm optional field hoặc runtime override.