AI 每日快讯

AI 每日快讯

AI 产品、模型、开源工具和官方动态的时间流。保留历史记录,按分类、日期和标签继续筛选。

3232历史快讯
177开源工具
3当前结果
08 月 27 日 2026-08-27 快讯

Cohere 发布 Parse 5:2.3B 视觉语言模型,将企业文档精准转为 Markdown

一句话结论:Cohere 的 Parse 5 是一个专攻文档解析的 2.3B 视觉语言模型,能将 PDF、幻灯片和图片转换为带 HTML 表格、边界框和图像描述的 Markdown。原始信息显示,该模型 API 定价为每 1000 页 $1.50,或使用专用 Model Vault 实例每月 $2500 起。在 ParseBench 基准上得分 79.2,超过 Mistral OCR 4、Azure Document Intelligence 和 Databricks AI Parse。值得关注的原因是,高质量文档解析是 RAG 和企业知识管理的基础环节,Parse 5 的性价比和性能优势可能改变企业文档处理的技术选型。受影响的是构建 RAG 系统的开发者、企业知识库管理者以及需要处理大量非结构化文档的团队。下一步建议使用 API 测试 Parse 5 在你自己的文档样本上的表现,特别是复杂表格和扫描件,并对比现有 OCR 或解析方案的成本与效果。

08 月 13 日 2026-08-13 快讯

agent-vision-toolkit:给纯文本大模型装上“眼睛”的开源视觉工具箱

一句话结论:这是一个专门为纯文本大模型设计的视觉技能工具箱,让它们能“看图”并执行图像相关任务。原始信息显示,该项目支持多图理解、图片问答、长截图OCR、前端UI还原和GUI自动化,并可无缝接入Codex、Claude Code等主流Agent框架。它值得关注,因为当前许多轻量级或文本优先的模型缺乏原生视觉能力,而该工具通过外部技能补齐了这一短板,扩展了模型在自动化测试、网页开发、文档处理等场景的实用性。主要影响开发者、AI产品经理和自动化测试工程师,他们可以借此在不更换底层模型的情况下获得视觉能力。下一步建议直接访问GitHub仓库,查看安装文档和示例代码,尝试用一张截图或图片运行图片问答或UI还原功能,以验证其效果和兼容性。

05 月 14 日 2026-05-14 快讯

Photo-agents:让AI代理拥有“照片级”记忆与自进化能力

一句话结论:Photo-agents 通过视觉记忆和自写技能,让AI代理能真正记住并操作你的电脑。该项目来自 GitHub,核心创新在于为LLM代理引入了基于视觉的分层记忆系统和自我编写技能的能力,使其能像人类一样通过“截图”理解屏幕并执行复杂任务。这值得关注,因为它解决了当前AI代理“记不住”、“学不会”的核心痛点,让自动化操作电脑从脚本执行迈向真正的智能体。主要影响开发者、自动化测试人员和所有希望用AI替代重复电脑操作的用户。下一步可以下载其开源代码,在本地环境部署并测试其视觉记忆和技能学习效果,验证其能否稳定完成多步骤任务。