会写代码还不够,还得能规划任务、调工具、把长流程跑完。星辰把这套能力收成一个可下载的百亿级MoE。
Xing4.0-29B-A4B由中电信人工智能科技有限公司于9月17日正式发布,权重随后上架Hugging Face等渠道,系列前身可追溯到TeleChat/星辰线。公开规格:总参数29B,每token激活约4B;原生256K上下文,可扩展至512K;64个路由专家、Top4激活,另有共享专家;注意力类型为MLA。定位是面向复杂工程任务的轻量级代码智能体,覆盖代码开发、数据分析、办公自动化与生活服务等场景。
华为方面同日口径强调训练底座:该模型是国内首个基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架完成训练的百亿参数级大模型。工程优化公开数字包括:多层次软硬件协同后整网训练吞吐相对开箱性能提升约96%;细粒度MoE相关优化吞吐提升约32%;选择性重计算再提升约19%;自研Ascend C mHC融合算子等再抬整网吞吐。强化学习侧称适配Slime框架,面向Agent、Coding、Reasoning做多专家强化学习。
部署侧,模型支持vLLM、SGLang、KTransformers,并适配LLaMA-Factory、MindFormers微调;对OpenCode、Claude Code、OpenClaw、Hermes等Agent框架做了格式对齐。多方复述4-bit量化后约15GB显存,便于在24GB消费卡上本地试用。对开发者,这是「可自托管的工程智能体基座」;对算力产业链,这是昇腾超节点从能训到训出可开源百亿MoE的又一次公开样本。