实测星火X2.5,我用摄像头造了5个「超亚比」体感应用
原创 夕小瑶编辑部 2026-09-08 18:25 北京

家人们,我最近用AI做了个东西,我相信有些家人们上班用得着~
昨天下午,我在工位玩砖块游戏(别问,问就是在体验AI)。

我的Boss刚好端着咖啡路过,屏幕“唰”一下,从游戏切成了一张密密麻麻的Excel预算表。
行列标题、工具栏、选中的单元格,全都有,里面还填着像模像样的预算数据。
Boss凑近看了两眼:“哟,算账呢?”
我:“对对对,我在算最近Token花了多少钱。”
他端着咖啡走了。
屏幕弹出一行提示:“第二张脸已离开。”我点了一下恢复,砖块接着飞,分数还在。

这个厉害吧!这是我让AI给我做的【老板来了】,用的AI是科大讯飞昨天发布的星火X2.5。

官方说,这次重点提升了代码和智能体能力,那我就来测测。
现在让AI写个网页已经不稀奇了,我在想我们能不能测得稍微有趣一点?
我想看一段需求交给它,最后能不能变成一个玩得起来且有趣的应用。比如说把一些想法做成体感交互的小应用,可以把摄像头、动作识别、画面渲染和交互规则接到一起。
我管这类玩法叫「超亚比」体感,这个词借了《奥拉星》里强化到顶的设定——
意思就是比普通交互更进阶、更带感。
◈伸手抽张签,给打工人一点好运
第一个需求是,我想给打工人加一点精神补给:做个不用鼠标、伸手就能玩的“今日签”。
需求是这样的:让一张张签卡组成悬浮的 3D 卡片球,摄像头识别我的手。张开手掌左右拨动,卡片球跟着转;拇指和食指捏在一起,就把选中的卡片抽出来,放大到眼前。看完松手,再把它放回去。
比起单纯生成一段漂亮动画,我更想试试,隔着屏幕,能不能有一点“亲手拿起东西”的感觉?

技术上来分析就是,手势识别和画面反馈能不能接起来。
这里的难点,是让选卡、捏住、移动、松开这几个动作连起来。手指指向哪张,抽出来的就应该是哪张;捏住不放,卡片也不能反复弹出。
第一次打开网页,卡片倒是在飘,我对着摄像头抓了半天,没什么反应。。。
后来发现,抓取的判定阈值设得太死,我又让它调整成动态阈值,效果就出来了!
手伸进摄像头画面,屏幕上会出现对应的手部轮廓。
我在卡片球前移动手指,选中的卡片随之亮起;拇指和食指一捏,那张卡片便从卡片群里抽出来,放大到眼前。
这个体验比我预想的好。
原本只是网页里的一个元素,现在多了点可以伸手去拿的感觉。
既然能拿起来,能不能再把它放到指定位置?
◈捏住一颗星星,把它送回家
沿着这个想法,我又加了一条游戏规则,再上上难度:识别到捏合以后,再拖到对应的位置,松手才算完成。
于是,就有了“星光捕手”:屏幕上飘着不同颜色的星球,用食指和拇指捏住一颗,拖到同色星门里,再松手放进去得分。
这个需求看起来只是多了个计分,但真正做起来,其实需要考虑的很多。
比如,我捏手指的时候,到底抓哪一颗?总不能手在左边,把右边的星球吸过来。也不能两颗星球挨得近,一把全抓走。
效果是这样:
实际玩下来,延迟不高,抓取、拖动、释放的手感也不错。目前属于已经能玩,但我还想继续盘的程度。
提示词给大家,有兴趣的家人可以拿去盘:
做一个可以用手势玩的“星光捕手”网页。屏幕中漂浮着不同颜色的星球,食指与拇指捏合抓住光标附近的一颗星,移动手可以拖动,松开后释放。把星球送进同色星门得分,送错要反馈但不能加分。设计 60 秒挑战、剩余时间、分数、重新开始以及难度递增。 操作要有明确的瞄准、抓住与释放反馈,捏合时不能隔空抓住远处物体,一次只能抓一颗。手离开画面时暂停或释放并解释当前状态,回来后可继续;重新开始时分数、计时器和物体全部复位,不能叠加多个计时器
我也顺手试了一下前端网站生成。
让它做一个“未来交互展”,把各种新奇的交互方式装进同一个网页展厅。
页面的功能比较完整,首页的3D粒子会随着鼠标移动,跟手程度也不错。
整体来看,最惊艳到我的,还是首页粒子交互的视效。
要我自己写,这部分确实得花点时间动脑子。
◈老板一入镜,游戏秒变工作表
然后,就轮到开头那个【老板来了】。

这个需求和我老板一样刁钻:
我的游戏必须真的能玩,有操作有分数,不能是个壳,摸鱼我必须摸的像样。
表格必须真的像Excel,行列标题、工具栏、可选中可编辑的单元格,一个不能少,不能贴张图片糊弄,老板没有那么好骗的。我还要可复用的,毕竟我的工作内容一直在更新。
检测到第二张脸要覆盖整个游戏区域并暂停游戏,不是弹个提示就算完。
人走了不许一惊一乍来回闪,得给手动恢复按钮。
摄像头只有我主动点才开启。
这绝对是一个好的考题,功能蛮多蛮复杂,需要会写代码+会功能配合+高智商。
来看实测:

实测录屏里,我打着砖块,老板入镜,检测人数从1跳到2,屏幕瞬间切成Excel表,游戏当场冻结。老板离开,提示"第二张脸已离开",点按钮,游戏从暂停处接着来。
我比较满意的就是这个细节做得很好。
“切成表格”只是最显眼的一步,暂停、等待、恢复这些地方处理好了,它才真的能用。而且那张表格里的单元格确实可以选、可以改,并不是贴了一张Excel图片。
我的提示词也给大家,因为我感觉家人们或许用得上【狗头表情】:

所以,这几个案例让我看到的,是星火X2.5能把一个想法做成可运行应用的能力。
一个真能跑起来的应用,是一条完整的链路:调摄像头、做人脸或手势识别、跑3D渲染、处理实时视频流里的噪声。
任何一个环节断掉,前面全白开发了,不只交付代码片段,要交付的是一个能跑、能扛事儿的系统。
◈赋予我真实魔法
然后,再给大家看两个视觉交互上更有意思的!(我直呼🐮🍺的)。
第一个,双手魔法阵。
双手靠近、拉开、转动,金色法阵就跟着展开、收拢、变化。
我张开双手,金色法阵在身前展开,周围还有飞来的碎片。再向镜头推掌,画面里便出现一波冲击效果。
(Ps:前面是在抓星星,到这里已经开始施法了。。。)
从展开法阵到推掌释放,动作有了连续的玩法,多少有点在工位上练魔法的感觉了。。。
提示词:

另一个是《洛神赋图》手势交互网页。
这个我参考的是博物馆里用手电筒照亮长卷、去看画面细节的体验,让它用摄像头识别手势,把手变成一支“虚拟手电筒”。
从视频中可以看到,光照会跟着手移动,照到哪里,哪里的画面就从暗处显出来,光圈大小也能随手离屏幕的距离变化。
这个效果我还挺喜欢的~~
提示词我也给大家公开了:
请做一个 顾恺之洛神图卷 手势交互网页,参考博物馆中用手电筒照亮长卷、发现故事的体验。 用户打开摄像头后,用一只手在空中移动,就像拿着火把探索:手掌中心控制照明中心,附近恢复底图的清晰细节与暖色,外围逐渐过渡回暗处。光圈边缘柔和,中心明亮但不过曝,直径默认约舞台短边的三分之一;张开手掌光圈变大,握拳变小,变化连续且稳定。无须真实手电筒,不要做成只移动一个发光圆点;核心是局部照亮原图
◈结语
按照官方公布的信息,星火X2.5采用MoE架构,总参数293B,每次激活约30B,覆盖200多种语言。
不过这次玩下来,我比较有感的是,还是对着摄像头捏星星、开法阵的那几分钟。
以前操作网页,手基本放在键盘鼠标上。这次,张开手、握拳、转动手掌,都能变成操作,进一步打破了人机交互的边界,不再是敲击与点击,而是姿态、手势与身体的自然语言,让“意图即执行”成为可能。
另一个让我感兴趣的,是官方介绍,星火X2.5的训练和推理全流程基于国产算力完成。
这背后要解决的事情不少。大尺寸模型要跑起来,计算、通信、显存管理和软件适配都得配合好,换一套硬件,也需要把相应的软件和工程能力补起来。
全国产路线的价值,就在于逐步把这套能力掌握起来:从底层算力到模型训推,遇到瓶颈可以更有针对性地适配和优化,也能减少对特定海外硬件生态的依赖。
对我来说,好奇的落点还是很直接:这套技术最后做出来的模型,面对我这些有点刁钻的需求,到底好不好用?
这次几个案例跑下来,我是愿意继续给它加难度的。
此外,讯飞近期还开源了X2.5-4B和1.7B两个端侧小模型。按照官方介绍,它们原生支持100万Token上下文,在其智能家居控制测试中,指令正确率达到90.3%,平均响应时间为0.85秒。
这部分我还没实测,先记下来,后面有机会再单独盘。
价格也放一下,按平台公布的信息:星火X2.5的价格是输入1.6元/百万Token,缓存命中输入0.24元/百万Token,输出6元/百万Token。
家人们如果也感兴趣,可以去讯飞开放平台试试,最近限免哎:
传送门:
如果跑出了什么好玩的,评论区分享一下,我也想抄抄你们的作业~

