在人工智能领域,AOE Tech Labs凭借一系列创新产品逐渐成为行业焦点。这家公司并非以传统意义上的模型突破吸引眼球,而是通过深度优化系统架构,在真实办公场景中实现了AI Agent应用的重大跨越。
今年初,Floatboat客户端率先将文件管理、编辑和浏览功能整合为Agent运行环境,开创了桌面工作台新形态。随后发布的FloatIM构建了跨人跨Agent的办公网络,FloatSchedule则让Agent具备自主按日程执行任务的能力。这些产品形态创新背后,是名为Harness的核心系统在持续发力。
八月公布的基准测试数据揭示了这套系统的真实实力。在五项第三方评估中,采用DeepSeek V4 Flash模型(每百万token输入0.14美元、输出0.28美元)的Floatboat Harness,在混合成本仅0.175美元/M的情况下,全面超越成本高达10美元/M的Claude Opus 4.8系统。测试覆盖代码修改、多应用自动化、跨平台检索等复杂长程任务,展现显著优势。
对比实验数据极具说服力:同一模型在官方Harness下得分54.4,接入Floatboat后跃升至67.25。在Terminal Bench 2.1测试中,官方系统与Opus 4.8持平,而Floatboat实现全面超越。这种差异源于系统架构设计——当模型能力趋同时,执行系统的优化成为关键变量。
研究团队特别强调任务长度与系统增益的正相关关系。在短程任务中,Harness带来的提升约为1.9%,但随着任务复杂度增加,这一数值在中程任务中升至9.6%-12.6%,在长程任务中更达到19.9%-23.6%。这种特性完美契合真实办公场景需求,用户日常处理的跨文件、跨应用、需多次修正的复杂工作,正是系统优势最突出的领域。
为量化系统价值,团队提出Harness杠杆率(HLR)指标。通过计算更换执行系统与升级模型的收益比值,发现仅优化Harness带来的性能提升,相当于将模型升级至贵57.1倍的Claude Opus 4.8所获得的改进幅度的3.6倍。在特定测试项中,这个比值甚至达到3.57倍,证明系统优化的投入产出比远超模型升级。
深入分析长程任务失败原因发现,传统系统主要面临两大挑战:用户初始需求模糊导致目标漂移,以及模型每轮生成的微小偏差在长流程中被持续放大。Floatboat的解决方案是通过动态目标校准机制,在执行过程中不断明确交付标准,同时建立偏差检测与修正循环,确保任务始终朝正确方向推进。
这种系统性创新需要多层次技术支撑。自研的Runtime系统提供真实的文件操作和环境访问权限,Agent Loop实现智能任务规划与偏差纠正,精细化设计的Tools确保模型正确理解工具反馈,而强大的Infra架构则支持任务状态持久化和失败回溯。四层技术栈的深度整合,使系统具备持续进化的能力。
值得注意的是,当前公布的测试数据实际上有所保留。用户实际使用的Floatboat客户端集成了文件管理、编辑、浏览等原生功能,并接入3000多个在线服务。这种完整的工作环境将产生更短的执行路径和更丰富的上下文信息,预计在实际场景中能带来更高的性能提升。
成本优势同样具有战略意义。当单次任务成本降至可忽略水平时,用户不再需要谨慎规划AI使用时机,这种使用方式的转变将推动AI Agent从演示阶段进入真实工作流。测试数据显示,在相同预算下,Floatboat系统可执行的任务数量是传统方案的57倍以上。
目前,AOE Tech Labs已开放基于DeepSeek的专版服务,首月注册费用仅1美元。用户可通过实际任务对比验证系统性能差异,特别是在代码仓库修改、跨平台报告生成等复杂场景中,亲身感受系统优化带来的效率质变。这种开放验证策略,展现了团队对技术实力的充分自信。











