Bỏ qua tới nội dung
Môi trường phát triển

Bạn đang ở môi trường phát triển

Đây là môi trường phát triển, không dùng cho production. Nếu bạn là khách hàng tiềm năng, vui lòng tiếp tục trên trang chính của chúng tôi.

Tới trang chínhonenexus.cloud

Nền tảng / Inference

Hai cách chạy inference,
một API tương thích duy nhất

Gọi một Platform model mà OneNexus đã vận hành, hoặc triển khai self-hosted model do tổ chức của bạn sở hữu.

01 — Platform models

Gọi Platform model

Shared catalog dùng chính API của OpenAI, nên client và mã nguồn của bạn giữ nguyên. Chỉ ba thứ thay đổi: base URL, một Platform API key, và model value.

python

import os

from openai import OpenAI

client = OpenAI(
    base_url=os.environ["ONX_BASE_URL"],
    api_key=os.environ["ONX_API_KEY"],
)

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module"}],
)

print(resp.choices[0].message.content)

curl

curl $ONX_BASE_URL/chat/completions \
  -H "Authorization: Bearer $ONX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

# Base URL and API keys both come from the console

ONX_BASE_URL → https://catalog.onenexus-do.cloud/v1

Làm theo quickstart cho Platform model.

02 — Mô hình

Các mô hình OneNexus đang vận hành

GLM-5.3

Đang mở pilot

Công việc dài hạn, suy luận chuyên sâu và các dự án agentic. Có thể kết hợp hiệu quả với subagent dùng model nhỏ hơn cho các tác vụ ở quy mô dự án.

Cửa sổ ngữ cảnh

500K theo cấu hình

Giới hạn và năng lực được xác nhận trong quá trình tiếp nhận.

Định dạng API

OpenAI

endpoint tương thích

Gọi công cụStreamingĐầu ra JSON Schema

DeepSeek-V4-Flash

Đang mở pilot

Các tác vụ hằng ngày, nhanh và hiệu quả.

Cửa sổ ngữ cảnh

500K theo cấu hình

Giới hạn và năng lực được xác nhận trong quá trình tiếp nhận.

Định dạng API

OpenAI

endpoint tương thích

Gọi công cụStreamingĐầu ra JSON Schema

Mức sẵn sàng của mô hình, giới hạn ngữ cảnh và công suất được xác nhận khi thiết lập pilot.

03 — Self-hosted models

Hai cách chạy mô hình do tổ chức của bạn sở hữu

Huấn luyện mô hình ngay trên nền tảng, hoặc mang weight bạn đã có. Cả hai cách đều phục vụ từ endpoint của bạn, và đều cần inference GPU quota.

Huấn luyện trên nền tảng

Huấn luyện mô hình bằng OneNexus Training, rồi triển khai kết quả cho tổ chức của bạn mà không cần đưa ra ngoài nền tảng.

Khám phá OneNexus Training

Weight bạn mang tới

Triển khai weight của model công khai, hoặc checkpoint riêng mà tổ chức của bạn đã có, phía sau một endpoint tương thích OpenAI.

04 — Kiểm soát vận hành

Những lớp kiểm soát quanh mô hình

Các thành phần vận hành quanh mỗi lần gọi mô hình.

Thiết lập khối lượng công việc

Thống nhất người dùng, quyền truy cập và ranh giới trước khi bật dịch vụ.

Mức dùng và hạn mức

Theo dõi mức dùng theo đội và theo key, với các giới hạn được thực thi.

Theo dõi mức dùng

Xem request và token usage theo model trong Console.

Chọn mô hình tường minh

Mô hình bạn chỉ định chính là mô hình được chạy.

Bắt đầu với hướng nào cũng được

Shared catalog chỉ cần một Platform API key. Self-hosting cần inference GPU quota, và cho bạn mô hình do tổ chức của bạn sở hữu.