自动化日常电脑操作将取代写代码,成为AI最大的商业机会。
很多人习惯于把大模型当成一个“高级编译器”或“代码助手”,但 Prentis 的逻辑是:与其让 AI 帮程序员写代码,不如让 AI 直接接管人类在电脑上那些重复、枯燥的 UI 操作。说白了,他们想做的是一个能够像真人一样操作系统的 AI Agent,而不是一个简单的聊天机器人。
这种从“代码生成”到“任务自动化”的重心转移,其实触及了目前 AI Agent 实战中的一个痛点——API 依赖。现在的自动化大多依赖于软件提供的 API,但绝大多数办公软件并没有开放完整的 API。如果 Prentis 能在视觉识别和模拟点击上取得突破,那么无论是处理复杂的报销流程,还是在多个 SaaS 软件之间同步数据,都不再需要开发者去写繁琐的集成代码。
如果想在自己的工作流中尝试类似的“自动化操作”思路,目前最接近的实操方案是利用一些支持屏幕感知的大模型(如 Claude 3.5 Sonnet)配合自动化脚本。比如,你可以尝试用 Python 的 pyautogui 库来构建一个简单的坐标点击原型,结合 AI 的视觉分析结果来驱动。
下面是一个简单的 Python 自动化触发逻辑示例,可以用来测试 AI 识别屏幕元素后的执行链路:
import pyautogui
import time
# 假设 AI 已经通过视觉分析给出了目标元素的屏幕坐标 (x, y)
# 这是一个模拟 AI Agent 执行点击任务的极简逻辑
def execute_ai_action(target_x, target_y, action_type="click"):
try:
if action_type == "click":
# 移动到坐标并点击,duration 增加模拟真实感,避免被部分软件判定为机器人
pyautogui.moveTo(target_x, target_y, duration=0.5)
pyautogui.click()
print(f"Successfully executed {action_type} at ({target_x}, {target_y})")
except Exception as e:
print(f"Action failed: {e}")
# 模拟 AI 识别到某个按钮在 (500, 600) 处
# 在实战部署中,这里的坐标应该是从 Vision LLM 返回的 JSON 中解析出来的
target_coords = {"x": 500, "y": 600}
execute_ai_action(target_coords['x'], target_coords['y'])当然,这种基于坐标的方案在实际部署中会遇到极其严重的“踩坑”点:屏幕分辨率不统一。同一个按钮在 1080P 和 4K 屏幕上的坐标完全不同。真正的解决方案必须引入“相对位置”或“图像特征匹配”。比如使用 pyautogui.locateOnScreen('button.png') 来动态寻找元素,而不是死磕绝对坐标。
Prentis 拿这么多钱,大概率是要在底层解决这种“跨设备、跨分辨率”的精准操作问题。如果他们能把这个闭环跑通,我们可能真的不需要学习复杂的低代码平台或编写自动化脚本,只需要对 AI 说一句“帮我把上周所有发票整理成表格并发送给财务”,它就能自动打开浏览器、登录系统、下载文件、填表并发送邮件。
对于开发者和产品经理来说,关注点应该从“如何写出更好的 Prompt”转向“如何构建可靠的执行环境”。当 AI Agent 具备了操作 OS 的能力,一个完整的 AI 工作流应该是:感知 (Vision) -> 决策 (Reasoning) -> 执行 (Action/OS Control) -> 验证 (Verification)。
这种方向的潜力极大,因为它把 AI 的应用场景从“对话框”直接推到了“桌面”,极大地降低了普通用户使用 AI 的门槛。