Google 推出 Gemini Agentic Video:视频理解最高降 88% Token,成本降 66%Google 推出 Gemini Agentic Video Understanding,让模型按任务主动搜索和重看视频片段。官方称其最高可减少 88% Token、降低 66% 成本,并提升最多 7% 准确率,现已向 Gemini API 开放。2026/09/02阅读全文
阿里云 Wan 3.0 视频生成模型开放体验:面向 Agent 的多模态视频创作能力阿里云 Wan 3.0 面向 AI 视频创作和 Agent 场景开放体验,支持多模态参考输入、最长 30 秒视频生成及 720P、1080P 输出。本文整理其核心能力、使用方式、适用场景和公开计费信息。2026/08/07阅读全文
PixelRAG:让 AI 直接理解网页截图的开源视觉 RAG 框架PixelRAG 是一个开源视觉 RAG 项目,它突破传统网页文本解析方式,让 AI 通过截图理解网页结构、表格和视觉信息。该项目探索了多模态模型时代知识检索的新方向,为智能搜索和 AI Agent 提供新的技术思路。2026/07/31阅读全文