桌面AI从屏幕录像中学习 | AI生成和翻译

首页 2026.07

问题:这篇AITNT文章是关于什么的? https://m.aitntnews.com/newDetail.html?newId=26238

答案:

本文介绍的是Agivar,一款由非十科技(Fitten Tech) 发布的桌面AI智能体。其核心理念是:人类无需编写复杂的提示词来告诉AI如何操作软件,而是通过一次屏幕录制向AI展示你的工作方式,AI便能学习该工作流并重复执行。([AI TNT][1])

文章将其定位为尝试替代当前由FDE(前沿部署工程师) 角色完成的部分工作。FDE是指那些深入企业内部、理解复杂业务流程,并将人工工作流转化为AI自动化的工程师。文章宣称,Agivar试图自动化这一转化步骤。([AI TNT][1])

核心机制

传统RPA:

人类
 |
 | 定义精确点击
 v
自动化脚本
 |
 v
计算机

示例:

click(300,500)
type("发票编号")
click(submit)

非常脆弱。

Agivar提出的工作流程:

人类演示任务
        |
        v
屏幕录制
        |
        v
AI观察:
 - UI元素
 - 用户意图
 - 顺序
 - 条件
        |
        v
AI创建可执行工作流
        |
        v
重复执行任务

文章指出,它并非像旧版“按键精灵”那样仅记忆坐标,而是试图理解操作背后的任务逻辑。([AI TNT][1])


架构思路

技术上的有趣之处在于“大脑+小脑”架构:

              用户目标
                  |
                  v
          大型多模态模型
              (“大脑”)
                  |
      规划 / 推理 / 恢复
                  |
                  v
          小型专用模型
             (“小脑”)
                  |
      视觉 + 点击 + 输入
                  |
                  v
             桌面操作系统

文章指出:

([AI TNT][1])

这实际上是一个非常合理的架构。你不需要每次鼠标移动都动用GPT-5级别的推理。

类似类比:

人类:
  大脑皮层      -> “从广州开车到深圳”
  小脑          -> “控制方向盘”

智能体:
  LLM          -> “完成发票处理”
  小型VLM      -> “点击这个按钮”

为何有趣

企业AI的最大瓶颈并非模型智能。

而是:

“如何将AI与成千上万个丑陋的内部系统连接起来?”

许多公司拥有:

普通的API自动化无法奏效。

桌面智能体攻击的是这一层:

无API
 |
 v
视觉 + 计算机使用
 |
 v
AI员工

这与以下方向一致:

文章提到Claude Cowork和OpenAI Codex桌面智能体也属于这一更广泛的趋势。([AI TNT][1])


我的技术评估

这个想法是真实的,但难点在于:

1. 可靠性

LLM是随机性的。

对于演示:

AI正确点击按钮 95%

看起来很棒。

对于企业:

每天1万张发票
需达到99.99%的正确率

则困难得多。

文章提到了:

以提高确定性。([AI TNT][1])


2. 从视频中学习工作流

这基本上是:

视频 -> 动作序列 -> 潜在程序

一个非常有趣的研究方向。

可能的流程:

屏幕视频
    |
    v
视觉编码器
    |
    v
UI状态提取
    |
    v
轨迹建模
    |
    v
工作流图
    |
    v
执行器

这与以下方向接近:


3. “AI FDE”概念

这可能是最强的商业洞察。

目前:

公司想要AI自动化

        |
        v

聘请顾问/FDE

        |
        v

工程师研究工作流

        |
        v

构建智能体

未来:

员工录制工作流

        |
        v

AI学习工作流

        |
        v

智能体部署

这大大降低了部署成本。


与你“多智能体工厂”理念的关系

这实际上与你之前“AI员工工厂”的思考高度一致。

未来的公司可能如下:

人类专家
     |
     | 演示工作
     v
工流学习智能体
     |
     v
100个AI工人副本
     |
     v
业务产出

瓶颈从:

招聘工人

转变为:

收集演示并改进智能体。


关于非十科技

非十科技是以下产品的母公司:

文章指出,团队源自清华大学计算机系和计图深度学习框架开发。([AI TNT][1])


我的看法:Agivar主要不是一个“更好的聊天机器人”;它试图构建LLM之后的下一层:能够学习人类工作流程的运营智能体。 关键战役将在于可靠性、延迟和企业集成,而不是原始模型智能。

参考文献:

[1]: https://m.aitntnews.com/newDetail.html?newId=26238

非十科技推出桌面智能体Agivar,从替代年薪300万的前沿部署工程师

” [2]: https://www.aitntnews.com/?utm_source=chatgpt.com “AITNT-让一部分人先用AI实现商业化”


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助