码农之家

专注优质代码开发,为软件行业发展贡献力量

端侧多模态、通用触觉与推理加速同频共振

1. DeepSeek 发布 DSpark:大模型推理加速再进一步,开源工具链同步放出

近日,DeepSeek 团队发布了一篇由梁文锋署名的新论文,提出面向大模型推理的加速方案 DSpark。该方案的核心思路是:把并行推测解码与轻量顺序修正结合起来,在保证输出质量不变的前提下,让单用户响应速度提升约 85%,高并发场景下有效吞吐最高可翻 4 倍。

具体而言,DSpark 先用一个并行骨干网络一次性生成多个候选 token,再用一个低成本的马尔可夫顺序头逐位置注入前缀依赖,修正并行生成中常见的“后缀衰减”问题。论文中的所有加速数字,都是与 DeepSeek-V3 已采用的 MTP-1 基线对比得出的,意味着这 60%–85% 的提速是在已有优化基础上的进一步叠加。

更值得注意的是工程落地细节。DSpark 配套了一个名为 DeepSpec 的全栈训练库,已把 Eagle3、DFlash、DSpark 三类草稿模型的训练代码开源,并支持 Qwen3、Gemma 等外部模型。也就是说,其他团队可以直接基于这套工具,为自己的大模型训练专属草稿器。

值得关注:当大模型能力差异逐渐缩小,推理成本和响应速度正成为下一个核心战场。DeepSeek 这次不仅给出了一套性能亮眼的技术方案,还配套了可复用的训练基础设施。DSpark 的加速收益能否在真实业务负载中稳定复现,值得持续跟踪;而它的开源姿态,也可能进一步推动行业在推理效率上的集体竞赛。


2. 杭州 Om AI 发布 VLX:全球首个面向物理世界的端侧流式多模态模型系列

杭州 AI 团队 Om AI 近日发布了 VLX 系列模型,这是首个面向物理世界的端侧流式多模态模型。该系列包括三款定位不同的模型:VLX-Flow 负责持续流式感知,VLX-Seek 负责精准定位,VLX-Go 负责把感知结果转化为机器人可执行的短时航点。

与常见的“把云端大模型压缩到端侧”路线不同,VLX 从架构设计的第一天起就围绕端侧约束展开。它用 Linear Attention 加双层记忆机制,让视频流能够持续输入而不会因为上下文变长导致显存爆炸;用 Region Token 替代坐标自回归生成,降低定位任务的端侧部署成本;而 VLX-Go 仅用约 0.6B 参数,就能完成实时运动规划。

团队公布的参考数据显示:VLX-Flow 处理单路视频最快仅需 0.06 秒;VLX-Go 以约十分之一的参数规模,取得了优于更大模型的导航表现;VLX-Seek 则以 3B 级模型在目标检测等任务上达到甚至超过更大规模通用模型的效果。

值得关注:CVPR 2026 上,VLM/多模态相关论文占比已从去年 4.9% 增长到 10.6%。VLX 的出现,意味着多模态模型的竞争焦点正在从“更大、更通用”转向“更实时、更端侧、更能行动”。如果端侧流式多模态真能跑通感知—定位—行动的闭环,具身智能、无人机、智能摄像头等场景的落地节奏可能都会被改写。


3. Sharpa 联合清华等高校发布 FTP-1:首个通用触觉基础策略,打通 21 种传感器

机器人触觉领域迎来了一个重要节点。Sharpa 联合清华大学、UC Berkeley、上海交通大学、ETH Zurich 等机构发布 FTP-1,这是首个通用触觉基础策略,目标是让机器人触觉能力像视觉能力一样可预训练、可共享、可迁移。

FTP-1 基于约 3,000 小时、来自 26 个数据来源和 21 种不同触觉传感器的数据进行预训练。它的核心创新有两点:一是 MTTS(形态感知触觉 token 空间),能把任意触觉输入映射到 24 个语义一致的功能区域 token,让不同传感器在统一表示下对话;二是独立的触觉 Transformer 专家,避免触觉信号直接灌入视觉—语言 backbone 时干扰原有知识。

在真实机器人评测中,FTP-1 在传感器已出现在预训练数据中的任务上,平均成功率达到 62.5%,比基线 π₀.₅ 的 45.3% 高出 17.2 个百分点;在预训练阶段从未见过的新传感器上,提升更为显著,比最强基线高出 31.6 个百分点,而团队只需从头训练对应传感器的 encoder。

值得关注:长期以来,触觉机器人困在一个死循环里:没有统一表示,就难以形成统一数据集;没有统一数据集,就难以训练通用模型。FTP-1 用统一的触觉 token 语言、大规模异构数据集和独立触觉专家,把这个循环打破了。对具身智能而言,这意味着触觉不再只是视觉的配角,而可能成为与视觉并行的另一条基础能力线。


4. 南大 & 腾讯混元推出 HYDRA/HYDRA-X:单个 ViT Tokenizer 统一多模态理解与生成

南京大学王利民团队与腾讯混元联合发布了 HYDRA 系列工作,挑战了原生多模态模型中“理解用一套 encoder、生成用另一套 encoder”的主流做法。HYDRA 训练了一个基于 ViT 的统一视觉 Tokenizer,让它同时承担理解和生成的任务。

传统做法中,理解 encoder(如 SigLIP 2)学到的是语义特征,生成 encoder(如 VAE)学到的是重建特征,两者特征空间不一致,模型需要额外学习映射。HYDRA 通过一个 Generation-Semantic Bottleneck(GSB)模块,在生成路径和语义路径之间做投影,让同一个 Tokenizer 既能高质量重建,又能提供丰富的语义特征。

在 1.5B 参数规模下,HYDRA 在多模态理解评测中平均得分 63.1,显著超过基线 Show-o2 的 53.2;在生成评测 GenEval 和 DPG-Bench 上也有大幅提升。进一步推出的 HYDRA-X 把这一思想拓展到视频,支持图像理解、视频理解、图像生成、视频生成和指令引导图像编辑五个任务。

值得关注:原生多模态模型是 2026 年模型架构竞争的焦点之一。HYDRA 的意义在于,它证明了“一个统一 Tokenizer”这条路可以走得通,而且可能比解耦方案的上限更高。如果后续能在更大规模和更复杂任务上保持优势,它可能会影响下一代多模态模型的设计范式。


5. First Proof 第二批测试结果公布:AI 在严格数学测试中仍逊于人类顶尖研究者

在 AI 数学能力被广泛讨论的背景下,独立研究项目 First Proof 公布了第二批正式测试结果。该项目向四个基于公开模型的 AI 系统提出了 10 道研究级数学题,所有题目均来自数学家正在解决的未发表问题,并经过 30 位领域专家以匿名方式评审。

结果显示:四个系统中表现最好的也仅通过 6 道题,且没有任何一道题被所有系统同时攻克。AI 在部分题目中展现出新颖的证明思路,比如系统 A 在第 5 题中用一条与人类解法完全不同的路径,被评审评定为“无实质性问题”。但 AI 答卷也暴露出系统性缺陷:包括遗漏关键引用、虚构不存在的文献定理、在困难步骤上语焉不详,以及“几乎逐行照搬出题者已有论文却没有注明来源”的引用问题。

测试中的四个系统分别为:苏黎世联邦理工和奥胡斯大学团队的 ProofCouncil、UCLA 团队(含数学家陶哲轩)的 Moonshot Harness、OpenAI 的 ChatGPT 5.5 Pro,以及普林斯顿大学的 Momus。整个测试在亚马逊 AWS 独立服务器上运行,确保所有系统都无法获得额外人工帮助。

值得关注:这场测试的关键价值在于“题目设计”——它切断了 AI 从训练数据或公开文献中检索答案的路径。在真实研究场景下,AI 的强项是“在已有思想结构中找捷径、转译和复用”,但在“提出深刻猜想、构建理论框架”以及“判断哪个方向值得追逐”的直觉层面,与人类顶尖研究者仍有明显距离。它提醒我们,AI 当前更适合作为科研助手,而非独立研究者。


今日小结

今天的 AI 行业呈现出几条清晰主线:

  • 推理效率正在成为新的竞争高地:DeepSeek DSpark 用系统工程和模型协同设计,把大模型推理速度再推上一个台阶,并配套开源训练库,可能引发一波推理优化浪潮。

  • 多模态模型开始走向端侧与物理世界:Om AI 的 VLX 证明,端侧流式多模态不只是“小模型”,而是一种新的模型形态,可能成为具身智能和空间智能的基础设施。

  • 触觉进入基础模型时代:FTP-1 用统一触觉语言打破传感器壁垒,让触觉能力像视觉一样可迁移,这对机器人精细操作是重要一步。

  • 原生多模态架构持续进化:HYDRA/HYDRA-X 用单个 ViT Tokenizer 统一理解与生成,为下一代多模态模型提供了一种新的设计思路。

  • AI 科研能力的边界仍需理性看待:First Proof 的严格测试提醒我们,在切断“数据检索”这一捷径后,AI 的原创数学能力仍有明显短板,更适合作为人类研究者的辅助工具。

AI探究员大白

0 评论数