J01
Train a model
让大规模训练从容量申请走到可复现的实验与 checkpoint。
Object Storage / shared FSGPU clusterSoperator / KubernetesMLflow / checkpoint
Nebius 的产品边界不是“租 GPU”。它试图把 土地与电力 → GPU 集群 → 云控制面 → 推理 Token → Agent 实时上下文 压进同一条交付链。
点击任一模块查看它在栈中的职责。颜色刻意区分“正式产品”“平台原语”“并入能力”“行业方案”和“集团资产”,避免把收购、合作与可购买产品混成一团。
产品地图只有落到用户路径才有意义。下面不是功能清单,而是 Nebius 当前试图缩短的四条交付链。
让大规模训练从容量申请走到可复现的实验与 checkpoint。
把开放模型或自有模型变成稳定端点,而不是自己运营 GPU fleet。
让模型同时获得推理能力与最新 Web 上下文,再接入企业治理层。
覆盖机器人最难拼接的仿真、训练、数据飞轮和部署路径。
这一步最重要,因为 CEO 叙事很容易把收购、合作、未来路线和现有 SKU 压成同一个“full stack”。
集团资产可以创造协同或估值,但不属于同一条 AI Cloud 产品栈。
对 Agent-aware Model Proxy,Nebius 最短验证路径是把 Token Factory 当作一个 OpenAI-compatible provider:先跑通请求,再观察 route、latency、token、cost、error 与 fallback。GPU 集群和 SGLang 属于下一层企业 workload。
# Provider spike — no secret in source provider: nebius-token-factory base_url: https://api.tokenfactory.nebius.com/v1 protocol: openai-compatible auth: project_api_key request → route decision → Token Factory model endpoint → latency / input_tokens / output_tokens → cost attribution → fallback on timeout / 5xx / quota next artifact 1 successful call 1 forced failure 1 fallback trace
产品与并购状态变化快,本页以 2026-07-16 可见的 Nebius 官方产品页、文档和新闻稿为准。CEO 访谈只用于理解叙事,不替代产品事实。