有 Token,不停机

不是更快的芯片,不是更大的模型 instfree 一体机,一台为你的灵感而生的机器 本地推理·端云协同·数据从未离开

0
并发推理请求 · vLLM PagedAttention
0
单卡显存 · 可跑万亿参数模型
0
近场互联 · 组成私有超节点
0
数据留存本地 · 不出物理边界
产品线

两种形态,
同一个信念

不是给通用电脑装一个 AI 应用
是从主板、固件到内核都为任务执行而设计的一体机

桌面一体机 · Mac Studio 形态
Pro
“放在桌上的算力基站,30B 模型满血运行”
¥8,999 起
16GB+ VRAM 等效 B50 级 512GB NVMe AirymaxOS + Windows
  • AirymaxOS 内核级智能体操作系统 + AirymaxRT 运行底座,开机即跑智能体
  • 端云混合架构:端侧小模型执行,云侧大模型加密编排
  • vLLM PagedAttention 零碎片显存管理,128+ 并发在线服务
  • llama.cpp GGUF 全格式,24GB 跑万亿参数
  • 2 台 Pro 近场通信组超节点,共享算力线性扩展
  • 信创版 openEuler 24.04 兼容,面向政企安全场景
笔记本 · MacBook Air 形态
Air
“本质是一台个人电脑,却天生会跑智能体”
¥4,999 起
RTX 3050 级 2-bit GGUF 256GB SSD Windows + AirymaxOS
  • 预装 AirymaxRT 运行底座,开机即有智能体工作台,不必装环境
  • Windows 主系统 + AirymaxOS 双启动,办公与推理互不占用
  • 2-bit 量化,8GB 显存跑 13B 参数模型
  • llama.cpp 纯 CPU 推理 7B 模型,合盖断电也能跑任务
  • 超节点协作:小模型本地跑、大模型分发到 Pro 集群
  • Docker、VS Code、浏览器照常运行,智能体只是多出来的那一层

你的思考值得尊重
不应该变成他人训练的燃料

权重加载、上下文缓存、任务执行全在本机完成
云端只做加密编排

核心技术栈

四件事,
做到极致

不是把开源引擎打包成镜像交付
从内核调度器、显存管理到运行时 API 出自同一份设计

AirymaxOS内核级智能体操作系统
不是用户态的"假 AgentOS"——真正的内核级工程。基于 Linux 6.6 LTS 深度定制,从调度器、内存管理到 GPU 驱动层全面适配智能体工作负载。自定义 BSP 固件烧录,裸金属算力直达应用层,零虚拟化损耗。
Linux 6.6 LTS 自定义 BSP 裸金属调度 机制/策略分离 openEuler 兼容
AirymaxRT智能体运行底座
OS 级智能体运行框架,与 AirymaxOS 内核深度耦合。自动管理 GPU 显存分配、请求排队、模型热加载与端云混合路由。端侧小模型执行,云侧大模型加密编排,降低 Token 成本,数据留存本地。零配置启动,支持 vLLM 与 llama.cpp 双引擎无缝切换。
OS 级框架 内核耦合 零配置启动 端云混合路由 开放 SDK
vLLM高吞吐推理引擎
PagedAttention 分页式 KV Cache 管理,消除显存碎片。Continuous Batching 连续批处理,相同硬件数倍吞吐提升。FP16/INT8/INT4 多精度支持,单实例 128+ 并发请求。兼容 OpenAI API 协议,Pro 满载等效 B50 级算力持续输出。
PagedAttention Continuous Batching 128+ 并发 FP16/INT8/INT4 OpenAI API
llama.cpp纯 C++ 混合推理
纯 C/C++ 零依赖推理引擎。CPU/GPU 混合模式覆盖 CUDA、Vulkan、Apple Silicon。GGUF 量化格式 2-bit 到 FP16 全谱系。24GB 显存即可运行万亿参数大模型,极限量化突破硬件天花板。Air 笔记本纯 CPU 推理 7B 模型,无需独显。
纯 C/C++ GGUF 全格式 2-bit 极限量化 24GB 跑万亿参数 CPU/GPU 混合
全栈架构

从固件到算法,
一层不少

自定义 BSP 固件 → Linux 6.6 LTS 内核 → AirymaxRT 运行时 → 模型与任务层
四层同源构建,同一条 CI/CD 流水线验证

硬件层
裸金属架构
CPU 双通道
GPU 16GB+ VRAM
SSD NVMe 512GB+
TPU 张量处理器
BSP 固件
上电时序定制
安全启动固件签名
GPU 驱动直通调优
风扇曲线长任务压热
AirymaxOS
内核级智能体 OS
Linux 6.6 LTS
openEuler 24.04
UKUIQt6 桌面
AirymaxRT
智能体运行底座
vLLM高吞吐
llama.cpp轻量
7~30B预装模型
用户/应用发起任务
→
AirymaxOS 内核调度
→
AirymaxRT 策略路由
→
vLLM / llama.cpp 推理
→
GPU/CPU 裸金属执行
→
结果落盘本机
核心特性

九件事,
不妥协

九项能力,逐项为长时间任务执行而做
在通用电脑上叠加 AI 软件,做不到其中任何一项

内核级 AgentOS

不是用户态套壳。AirymaxOS 从 Linux 内核调度器、内存管理到 GPU 驱动全面定制,智能体工作负载直达裸金属,零虚拟化损耗。

机制-策略分离

OS 级框架封装调度、显存管理、请求排队等底层机制。开发者只写策略算法,开机即进入智能体开发状态。

超节点集群

2 台 Pro 近场通信组超节点,共享算力。Pro/Air 混合编组,7B 本地跑、30B 分发集群并行,算力线性扩展。

双推理引擎

vLLM 高并发在线服务 128+ 路;llama.cpp 轻量本地 2-bit 量化。24GB 显存跑万亿参数,8GB 显存跑 13B。

信创合规

openEuler 24.04 兼容,国产软硬件生态适配。Linux 6.6 LTS 长期支持内核,政企安全可控。

端云混合架构

端侧小模型日常执行任务,云侧大模型加密推理编排。混合路由降低 Token 成本,数据始终留存本地,架构层面消除泄露风险。

双系统切换

Pro 以 AirymaxOS 为主面向开发者,Air 以 Windows 为主面向消费者。均支持双系统,开发办公兼顾。

预装模型

出厂预装 7B~30B 主流开源模型,涵盖对话、代码、推理。无需下载配置,开机即执行。

UKUI 轻量桌面

Qt6 三层架构,资源占用远低于 GNOME/KDE。为推理保留更多系统资源,类 Windows 交互降低迁移门槛。

应用场景

你的第一个
智能体节点

同一套 AirymaxOS 与运行时
从一人一机的原型,到部门级 128+ 并发的私有服务

01

个人开发者

本地跑 7B–13B 原型,零云 API 费用;代码、权重、上下文全部留在本机。

机型
Air · 集显 / 8GB 显存
模型
7B–13B GGUF 量化
02

企业私有部署

合同、工单、代码库只在内网推理;集群常驻服务团队,长上下文不断档。

机型
Pro ×2 · 超节点
模型
30B 满血 · 128+ 并发
03

政企信创

openEuler 兼容发行版交付,审计留痕在本机;数据不出内网,推理不上公有云。

机型
Pro 信创版
模型
13B–30B 私域微调
04

教育科研

实验室开机即实验,预装多规格开源模型;学生专注算法,不再搭环境。

机型
Air / Pro 混编
模型
7B–30B 多规格
产品对比

Pro vs Air

同一份运行时、同一套 API
差别只在算力预算与携带方式

规格Pro推荐Air
形态桌面 Mac Studio 级轻薄 MacBook Air 级
起售价¥8,999¥4,999
GPU等效 B50,16GB+ VRAMRTX 3050 级 / 集显
推荐模型13B-30B 全精度7B-13B 量化
推理引擎vLLM + llama.cppvLLM + llama.cpp
操作系统AirymaxOS (Linux)Windows
双系统+ Windows+ AirymaxOS
桌面UKUI Qt6UKUI Qt6
信创版openEuler 24.04—
超节点2 台组集群与 Pro 协作
目标用户开发者 / 企业 / 政企消费者 / 个人开发者
装机答疑

常见问题,逐条拆解

Pro 桌面机配 16GB+ 显存、等效 B50 级算力,单实例 128+ 并发在线服务;Air 用 8GB 显存跑 13B,纯 CPU 也能推理 7B。极限量化下 24GB 显存即可运行万亿参数级模型,权重与 GGUF 全格式本地加载。

上下文与权重始终留在本机,不出设备物理边界。端侧小模型日常执行任务,仅云侧大模型按加密编排参与推理,混合路由压低 Token 成本、结果数据仍留存本地。信创版 openEuler 审计留痕在本机,面向政企安全场景。

Pro 以 AirymaxOS 为主,面向开发者与部门级私有推理集群;Air 以 Windows 为主、双启动,面向消费者。两台 Pro 近场互联即组成超节点,共享算力线性扩展。两者均预装 7B~30B 主流开源模型,开机即执行。

兼容 OpenAI API 协议,零配置启动;vLLM 与 llama.cpp 双引擎无缝切换,开放 SDK。自定义 BSP 固件烧录,裸金属算力直达应用层,从一人一机原型到 128+ 并发私有服务同一套 CI/CD 流水线验证。

有 Token,不停机

端云混合 · 本地算力 · 本地执行

端侧小模型日常执行任务,云侧大模型加密推理编排,混合路由压低 Token 成本
上下文与权重始终留在本机,不出设备物理边界
两台 Pro 近场互联,即刻扩成私有推理集群

协作生态