今日暂无新动态
整理思路中
ChatGPT、Claude、DeepSeek 今日动态
今日暂无新动态
整理思路中
今日暂无新动态
安静阅读中
今日暂无新动态
深海巡游中
共 15 篇
在电商、金融和社交网络等数字场景中, 欺诈检测 一直是个棘手的问题。欺诈行为往往隐藏在复杂的网络关系和冗长的文本信息中,传统的检测方法面临诸多挑战。
传统的 图神经网络 (GNN)虽然能有效利用图结构信息,但对文本语义的理解不够深入。而单纯依赖 大语言模型 (LLM)的方法虽然能处理文本语义,却容易因为邻居节点过多导致提示信息过长,关键信息被淹没在海量数据中。为了解决这个问题,新加坡国立大学与字节跳动数据库图团队合作提出了 DGP (Dual Granularity Prompting,双粒度提示框架)。
昨晚, DeepSeek 公司正式发布了其线上版本模型的重大更新—— DeepSeek V3.1 。这次更新带来了多项技术改进,其中最引人注目的是在编程基准测试中首次超越了此前领先的 Claude 4 Opus 模型,而成本仅为后者的六十八分之一。
根据官方发布的信息,V3.1 版本主要有三大更新。首先是 上下文窗口 从原来的 64K 扩展到了 128K,这意味着模型能够处理更长的文本内容。其次是在 Aider 编程基准测试中取得了 71.6% 的高分,超越了 Claude 4 Opus 的表现。最令人惊讶的是成本对比:完成相同任务,Opus 需要花费 69 美元,而 V3.1 仅需 1.01 美元。
AI 开发者 Nathan Lambert 指出,当前大模型分类不应简单分为"推理型"或"非推理型",而应视为一个推理努力程度的光谱。他提到 Claude 最早引入特殊标记和深度思考用户体验,而 DeepSeek v3.1 的具体推理机制尚未明确。 模型的实际能力需要通过 API 提供的精确标记计数来评估 ,这是最可靠的信息来源。
与此同时,博主 karminski-牙医对 DeepSeek-V3.1-Base 进行了代码编写实测,结果显示其性能 已经超越 GPT-5 ,接近 Claude-Sonnet-4 的水平。在三次测试中,DeepSeek 除了一次小错误外,其余测试均一次性通过,表现流畅稳定。
AI 研究领域迎来重要突破——GPT-5 Pro 成功证明了一个凸优化领域的开放数学问题,并且得出了比原论文更好的边界结果。这一成就由微软研究员 Sebastien Bubeck 亲自验证,确认其证明过程完全正确。
该突破迅速在 AI 学术界引发关注,OpenAI 联合创始人 Greg Brockman 将其描述为"AI 在数学领域展现生命迹象",而 Meta 研究员 Noam Brown 则指出"AI 助手已经在改变软件工程,数学将是下一个领域"。
对于想要拓展海外市场的中国初创企业来说,常常会遇到几个关键难题:如何快速构建适应全球市场的技术基础设施?如何精准触达海外用户并实现有效增长?如何在复杂的国际环境中实现商业变现?针对这些挑战, 谷歌 最近推出了一套完整的解决方案。
这套方案整合了谷歌旗下的多个核心产品和服务。在技术基础建设方面,Google Cloud 为符合条件的初创企业提供最高 35 万美元的云服务抵免额度,这些额度可以用于调用 Gemini 等先进 AI 模型,以及支付 GPU 和 TPU 等计算资源的费用。同时,企业还能获得专家的一对一出海咨询和全球市场进入资源。
Chain-of-Agents(代理链)技术实现了重大突破 ,通过多智能体蒸馏与智能体强化学习的结合,成功训练出具备多代理系统能力的单一基础模型。该模型在保持竞争力的同时,显著减少了推理令牌和工具调用,令牌成本降低了惊人的 84.6%。
相较于传统多智能体系统,AFM(Agent Foundation Model)展现出卓越的鲁棒性和泛化能力,特别是在需要严格格式化的场景下,能够更好地适应未见过的工具。测试结果显示,Best-of-3 和 pass@3 策略显著提升了模型性能,在 GAIA 和 HLE 基准测试中分别达到 69.9 和 33.2 的优异成绩。
开发者 Lucas Beyer 在社交媒体上分享了对 LLM 编程的观察,他认为像 Codex 和 Claude 这样的 AI 编程助手特别擅长处理那些 对人类来说繁琐无聊的样板代码 。
有趣的是,Beyer 提出了一个反直觉的观点:Java 这种以冗长著称的语言,可能在 LLM 编程时代反而具有优势。因为大量样板代码对人类开发者是负担,但对 AI 来说却提供了更明确的上下文和结构。
一场关于多模态人工智能模型的技术分享会将于 2025 年 8 月 21 日晚 8 点至 10 点在线举行。本次活动由 Hugging Face、OpenMMLab、ModelScope、知乎和机智流等机构联合发起,邀请了多个知名开源多模态模型的核心研发人员进行深度技术分享。
多模态大模型是当前人工智能领域的热点,这些模型能够同时处理文本、图像、视频等多种类型的数据。近期,多家机构纷纷开源了自己的多模态模型,在开源社区引发了广泛讨论。这些模型在参数规模、训练方法和应用场景上各具特色,为开发者和研究者提供了丰富的技术参考和实践灵感。
xAI 团队于 8 月 20 日晚间发布了 Grok App 的最新 v1.1.55 版本更新, 用户需及时更新应用以获取最新功能改进 。与此同时,Elon Musk 旗下的 AI 社区正在举办 Grok 想象大赛,邀请用户为 SpaceX、Tesla、xAI 等公司设计新产品,评选标准包括实用性、趣味性和未来感三个维度。
在社交媒体互动中,马斯克本人积极转发相关动态,对昨日获奖作品"火腿莓(hamberry)"表示赞赏,称其"令人印象深刻",展现了 Grok Imagine 视频的创意潜力。这种高频率的官方互动有效维持了社区活跃度。
xAI 最新发布的 Grok 应用 v1.1.53 版本带来了 Imagine 功能的显著改进,视频质量得到明显提升。用户现在可以享受更流畅、更智能的体验,包括增强的照片动画效果和新增的上传照片多选动画功能。
社区用户纷纷展示使用 Grok Imagine 创作的精彩作品,从带有呼吸立方晶格的玻璃球体到古罗马风格的视频内容,展现了该工具强大的创意表达能力。Elon Musk 及其家人也积极参与互动,Maye Musk 甚至用 Grok Imagine 重现了与双胞胎姐妹 12 岁时的蟒蛇照片。
Grok AI 助手在编程领域展现出突破性表现 ,开发者 Grummz 分享了他的使用体验:"过去一周我完全依赖 Grok 进行编码,这是首次实现 100% AI 辅助编程,连我自己都惊讶这些代码并非出自我的手笔。"这一体验得到了 Elon Musk 的转发认可,他强调"Grok 4 是唯一能做到这一点的模型"。
与此同时,不同 AI 助手的能力对比成为热门话题。Fahad Naseer 发起了关于世界顶级 AI 助手排名的讨论,列举了 Claude、Gemini、Grok 和 ChatGPT 等主流产品。在实际应用测试中,用户宝玉 xp 发现 Gemini 在文学作品角色查询方面表现更准确,而其他模型则存在信息编造的情况。
近日,智谱 AI 正式发布了 AutoGLM 2.0 版本,这是一款能够在云端自主操作手机和电脑应用的智能助手。与传统的对话型 AI 不同,这款产品真正实现了从“对话”到“执行”的跨越,让 人工智能 能够代替用户完成实际任务。
AutoGLM 2.0 的核心创新在于采用了“ Agent +云手机+云电脑”的技术模式。这意味着 AI 助手不是在用户本地设备上运行,而是在云端配备专属的虚拟手机和电脑环境。当用户需要点外卖、订机票或者处理工作时,只需通过语音或文字下达指令,AutoGLM 就会在云端操作相应的应用程序,完整执行整个流程,而用户的真实手机可以同时进行其他操作,比如玩游戏或刷视频。
2025 年 8 月 20 日,社交媒体巨头 Meta 宣布对其人工智能团队进行重大重组,这是该公司在短短六个月内第四次调整 AI 部门架构。此次重组将原有的 超级智能实验室 拆分为四个独立部门,标志着 Meta 在人工智能发展战略上的重大转变。
新成立的四个部门包括:负责探索性研究的 TBD Lab (待确定实验室)、专注于长期前沿研究的 FAIR (基础 AI 研究)、负责产品与应用开发的团队,以及专门的基础设施部门。其中,TBD Lab 由新任首席 AI 官 Alexandr Wang 领导,重点研发新一代大语言模型。值得注意的是,Meta 正在考虑放弃其长期坚持的开源策略,下一代模型可能转向闭源模式。
最近发布的 Kimi K2 模型在国际上引起了广泛关注,这个模型有一个特别的技术亮点:通过对海量训练数据进行重写处理,显著提升了模型性能。这种方法就像是给 AI 模型提供经过精心编辑的教材,让学习效率大大提高。
语料重写 的核心思想很简单:原始的网络数据往往存在格式混乱、信息冗余或表达不够清晰的问题。研究人员使用 AI 模型对这些数据进行重新表述,使其变得更加规范、易懂。在 K2 模型中,团队特别针对知识类和数学类内容进行了专门处理。对于知识类内容,他们采用多风格、多视角的改写方式,确保信息准确性的同时增加多样性;对于数学内容,则借鉴了 SwallowMath 方法,将数学文档改写成学习笔记的风格。
MAESTRO: Masked AutoEncoders for Multimodal, Multitemporal, and
Multispectral Earth Observation Data
MAESTRO 是一种针对地球观测数据的自监督学习方法,通过优化的融合策略和定制化的目标归一化方案,在多时相动态任务上达到最新最优性能,同时在单时相任务上保持高度竞争力。
自监督学习为遥感领域带来了巨大潜力,但标准的自监督方法需针对地球观测数据的独特特性进行适配。我们通过系统评估多模态、多时相与多光谱地球观测数据的融合策略及重建目标归一化方案,向该方向迈出一步。基于研究发现,我们提出MAESTRO——一种掩码自编码器(Masked Autoencoder)的创新改进方案,其具备优化的融合策略和定制化的目标归一化方案,通过引入光谱先验作为自监督信号。在四个地球观测数据集上的评估表明,MAESTRO在强依赖多时相动态的任务中刷新了最优性能,同时在单时相主导的任务中保持高度竞争力。实验复现代码详见https://github.com/ignf/maestro。