智能体原生一体机
有 Token,不停机

不是更快的芯片,不是更大的模型 instfree 一体机,一台为你的灵感而生的机器 本地推理·端云协同·数据从未离开

instfree pro · 银色一体成型 · 16gb+ vram · airymaxos
0
并发推理请求 · vLLM PagedAttention
0
单卡显存 · 可跑万亿参数模型
0
近场互联 · 组成私有超节点
0
数据留存本地 · 不出物理边界
产品线

两种形态,
同一个信念

不是给通用电脑装一个 AI 应用
是从主板、固件到内核都为任务执行而设计的一体机

桌面一体机 · Mac Studio 形态
Pro
“放在桌上的算力基站,30B 模型满血运行”
¥8,999 起
16GB+ VRAM 等效 B50 级 512GB NVMe AirymaxOS + Windows
  • AirymaxOS 内核级智能体操作系统 + AirymaxRT 运行底座,开机即跑智能体
  • 端云混合架构:端侧小模型执行,云侧大模型加密编排
  • vLLM PagedAttention 零碎片显存管理,128+ 并发在线服务
  • llama.cpp GGUF 全格式,24GB 跑万亿参数
  • 2 台 Pro 近场通信组超节点,共享算力线性扩展
  • 信创版 openEuler 24.04 兼容,面向政企安全场景
笔记本 · MacBook Air 形态
Air
“本质是一台个人电脑,却天生会跑智能体”
¥4,999 起
RTX 3050 级 2-bit GGUF 256GB SSD Windows + AirymaxOS
  • 预装 AirymaxRT 运行底座,开机即有智能体工作台,不必装环境
  • Windows 主系统 + AirymaxOS 双启动,办公与推理互不占用
  • 2-bit 量化,8GB 显存跑 13B 参数模型
  • llama.cpp 纯 CPU 推理 7B 模型,合盖不断电也能跑任务
  • 超节点协作:小模型本地跑、大模型分发到 Pro 集群
  • Docker、VS Code、浏览器照常运行,智能体只是多出来的那一层
机身视图

一块铝,
三个面

197 × 197 × 95 mm 的正四棱柱
正视与侧视同形,顶视是一个正方形
四张图,同一把尺

325 × 227 mm 的一块铝,前缘 2.8 毫米、转轴处 17.3 毫米
侧视是一条斜楔,正视才摊开成一块屏
四张图,同一把尺

197 mm 95 mm
正视 · 前置 USB-C ×2 直连本地存储,红色状态灯跟着智能体心跳
197 mm 95 mm
侧视 · 侧壁零开孔,进风走黑色底座这一圈 4 mm 缝,热风从背面出
197 mm 197 mm
顶视 · 占地 197 × 197,比一张 A4 的短边还窄
拖动可转 · 方向键微调 · R 复位
轴测 · 拖起来看:机身坐在 8 mm 黑色空心底座上,进风走这一圈 4 mm 缝,热风从背面格栅出,Ø 56 风扇坐在盖板正后方轴测 · 拖起来看:17.3 mm 到 2.8 mm 的一刀斜楔,屏在转轴上开到 110°,按「合」收进前缘那道 2.8 mm 的边里

你的思考值得尊重
不应该变成他人训练的燃料

权重加载、上下文缓存、任务执行全在本机完成
云端只做加密编排

核心技术栈

四件事,
做到极致

不是把开源引擎打包成镜像交付
从内核调度器、显存管理到运行时 API 出自同一份设计

AirymaxOS内核级智能体操作系统
不是用户态的"假 AgentOS"——真正的内核级工程。基于 Linux 6.6 LTS 深度定制,从调度器、内存管理到 GPU 驱动层全面适配智能体工作负载。自定义 BSP 固件烧录,裸金属算力直达应用层,零虚拟化损耗。
Linux 6.6 LTS 自定义 BSP 裸金属调度 机制/策略分离 openEuler 兼容
AirymaxRT智能体运行底座
OS 级智能体运行框架,与 AirymaxOS 内核深度耦合。自动管理 GPU 显存分配、请求排队、模型热加载与端云混合路由。端侧小模型执行,云侧大模型加密编排,降低 Token 成本,数据留存本地。零配置启动,支持 vLLM 与 llama.cpp 双引擎无缝切换。
OS 级框架 内核耦合 零配置启动 端云混合路由 开放 SDK
vLLM高吞吐推理引擎
PagedAttention 分页式 KV Cache 管理,消除显存碎片。Continuous Batching 连续批处理,相同硬件数倍吞吐提升。FP16/INT8/INT4 多精度支持,单实例 128+ 并发请求。兼容 OpenAI API 协议,Pro 满载等效 B50 级算力持续输出。
PagedAttention Continuous Batching 128+ 并发 FP16/INT8/INT4 OpenAI API
llama.cpp纯 C++ 混合推理
纯 C/C++ 零依赖推理引擎。CPU/GPU 混合模式覆盖 CUDA、Vulkan、Apple Silicon。GGUF 量化格式 2-bit 到 FP16 全谱系。24GB 显存即可运行万亿参数大模型,极限量化突破硬件天花板。Air 笔记本纯 CPU 推理 7B 模型,无需独显。
纯 C/C++ GGUF 全格式 2-bit 极限量化 24GB 跑万亿参数 CPU/GPU 混合
全栈架构

从固件到算法,
一层不少

自定义 BSP 固件 → Linux 6.6 LTS 内核 → AirymaxRT 运行时 → 模型与任务层
四层同源构建,同一条 CI/CD 流水线验证

硬件层
裸金属架构
CPU 双通道
GPU 16GB+ VRAM
SSD NVMe 512GB+
TPU 张量处理器
BSP 固件
上电时序定制
安全启动固件签名
GPU 驱动直通调优
风扇曲线长任务压热
AirymaxOS
内核级智能体 OS
Linux 6.6 LTS
openEuler 24.04
UKUIQt6 桌面
AirymaxRT
智能体运行底座
vLLM高吞吐
llama.cpp轻量
7~30B预装模型
用户/应用发起任务
→
AirymaxOS 内核调度
→
AirymaxRT 策略路由
→
vLLM / llama.cpp 推理
→
GPU/CPU 裸金属执行
→
结果落盘本机
核心特性

九件事,
不妥协

九项能力,逐项为长时间任务执行而做
在通用电脑上叠加 AI 软件,做不到其中任何一项

内核级 AgentOS

不是用户态套壳。AirymaxOS 从 Linux 内核调度器、内存管理到 GPU 驱动全面定制,智能体工作负载直达裸金属,零虚拟化损耗。

机制-策略分离

OS 级框架封装调度、显存管理、请求排队等底层机制。开发者只写策略算法,开机即进入智能体开发状态。

超节点集群

2 台 Pro 近场通信组超节点,共享算力。Pro/Air 混合编组,7B 本地跑、30B 分发集群并行,算力线性扩展。

双推理引擎

vLLM 高并发在线服务 128+ 路;llama.cpp 轻量本地 2-bit 量化。24GB 显存跑万亿参数,8GB 显存跑 13B。

信创合规

openEuler 24.04 兼容,国产软硬件生态适配。Linux 6.6 LTS 长期支持内核,政企安全可控。

端云混合架构

端侧小模型日常执行任务,云侧大模型加密推理编排。混合路由降低 Token 成本,数据始终留存本地,架构层面消除泄露风险。

双系统切换

Pro 以 AirymaxOS 为主面向开发者,Air 以 Windows 为主面向消费者。均支持双系统,开发办公兼顾。

预装模型

出厂预装 7B~30B 主流开源模型,涵盖对话、代码、推理。无需下载配置,开机即执行。

UKUI 轻量桌面

Qt6 三层架构,资源占用远低于 GNOME/KDE。为推理保留更多系统资源,类 Windows 交互降低迁移门槛。

应用场景

你的第一个
智能体节点

同一套 AirymaxOS 与运行时
从一人一机的原型,到部门级 128+ 并发的私有服务

01

个人开发者

本地跑 7B–13B 原型,零云 API 费用;代码、权重、上下文全部留在本机。

机型
Air · 集显 / 8GB 显存
模型
7B–13B GGUF 量化
02

企业私有部署

合同、工单、代码库只在内网推理;集群常驻服务团队,长上下文不断档。

机型
Pro ×2 · 超节点
模型
30B 满血 · 128+ 并发
03

政企信创

openEuler 兼容发行版交付,审计留痕在本机;数据不出内网,推理不上公有云。

机型
Pro 信创版
模型
13B–30B 私域微调
04

教育科研

实验室开机即实验,预装多规格开源模型;学生专注算法,不再搭环境。

机型
Air / Pro 混编
模型
7B–30B 多规格
产品对比

Pro vs Air

同一份运行时、同一套 API
差别只在算力预算与携带方式

规格Pro推荐Air
形态桌面 Mac Studio 级轻薄 MacBook Air 级
起售价¥8,999¥4,999
GPU等效 B50,16GB+ VRAMRTX 3050 级 / 集显
推荐模型13B-30B 全精度7B-13B 量化
推理引擎vLLM + llama.cppvLLM + llama.cpp
操作系统AirymaxOS (Linux)Windows
双系统+ Windows+ AirymaxOS
桌面UKUI Qt6UKUI Qt6
信创版openEuler 24.04—
超节点2 台组集群与 Pro 协作
目标用户开发者 / 企业 / 政企消费者 / 个人开发者
装机答疑

常见问题,逐条拆解

Pro 桌面机配 16GB+ 显存、等效 B50 级算力,单实例 128+ 并发在线服务;Air 用 8GB 显存跑 13B,纯 CPU 也能推理 7B。极限量化下 24GB 显存即可运行万亿参数级模型,权重与 GGUF 全格式本地加载。

上下文与权重始终留在本机,不出设备物理边界。端侧小模型日常执行任务,仅云侧大模型按加密编排参与推理,混合路由压低 Token 成本、结果数据仍留存本地。信创版 openEuler 审计留痕在本机,面向政企安全场景。

Pro 以 AirymaxOS 为主,面向开发者与部门级私有推理集群;Air 以 Windows 为主、双启动,面向消费者。两台 Pro 近场互联即组成超节点,共享算力线性扩展。两者均预装 7B~30B 主流开源模型,开机即执行。

兼容 OpenAI API 协议,零配置启动;vLLM 与 llama.cpp 双引擎无缝切换,开放 SDK。自定义 BSP 固件烧录,裸金属算力直达应用层,从一人一机原型到 128+ 并发私有服务同一套 CI/CD 流水线验证。

有 Token,不停机

端云混合 · 本地算力 · 本地执行

端侧小模型日常执行任务,云侧大模型加密推理编排,混合路由压低 Token 成本
上下文与权重始终留在本机,不出设备物理边界
两台 Pro 近场互联,即刻扩成私有推理集群

协作生态