今日暂无新动态
整理思路中

ChatGPT、Claude、DeepSeek 今日动态
今日暂无新动态
整理思路中
今日暂无新动态
安静阅读中
今日暂无新动态
深海巡游中
共 20 篇
埃隆·马斯克的人工智能公司 xAI 正式宣布开源其大语言模型 Grok-2,这一具有 9050 亿参数的模型采用混合专家架构(MoE),在推理时激活 1360 亿参数。 其混合专家架构在 Grok-1 的基础上进行了改进 ,成为目前最强大的开源模型之一。
Grok-2 的技术规格令人瞩目:支持高达 131,072 token 的上下文窗口,相当于能处理一本 200 多页的书籍内容;预训练数据更新至 2024 年初;模型体积达 500GB。开源内容包括模型权重和架构,但商业使用设有限制——仅当年收入低于 100 万美元时方可商用,且不得用于改进其他基础模型。
Jeff Dean 在最新访谈中分享了他在 AI 领域的探索历程。9 岁时接触编程,13 岁打印 400 页源码自学,这些早期经历奠定了他对技术的深刻理解。 “我喜欢神经网络,我们来训练超大规模的吧” ——这句与吴恩达在谷歌茶水间的对话,直接催生了 Google Brain 项目。他们用 2000 台计算机训练神经网络,最终在语音识别和图像处理领域取得突破性进展。
Dean 将 AI 模型比作“苏格拉底式伙伴”,强调其交互与推理能力。他认为当前 AI 已触及自我突破的门槛,关键在于形成自动化闭环:自动生成想法、测试并优化。 “在某些特定领域,LLM 自我突破已经触及门槛” ,这一判断基于强化学习和大规模计算的快速发展。
OpenAI 近期宣布与 Retro Biosciences 合作取得突破性进展,利用专为蛋白质工程设计的 AI 模型 GPT-4b micro,成功优化了“山中因子”的变体。山中因子是一组由诺贝尔奖得主山中伸弥发现的蛋白质,能够将成体细胞逆转为多能干细胞(iPSCs),但其传统方法的转化效率不足 0.1%。
“GPT-4b micro 设计的蛋白质变体诱导干细胞重编程的效率比野生型高出 50 余倍。” 实验数据显示,新设计的 RetroSOX 和 RetroKLF 变体不仅显著提升了多能性标记物的表达水平,还使细胞重编程时间从三周缩短至 7-12 天。此外,这些变体展现出更强的 DNA 损伤修复能力,为抗衰老研究提供了新思路。
这一成果的关键在于 GPT-4b micro 的独特训练方式。模型通过整合蛋白质序列、三维结构数据和生物学文本,生成了大量高活性变体,其设计阳性率超过 30%,远超传统方法的 10%。Retro Biosciences 的湿实验验证表明,AI 设计的变体在多种细胞类型和递送方式中均表现稳定,且衍生的 iPSCs 具备完整的多能性和基因组稳定性。
“当领域洞见与 AI 工具结合,数年难题或可在数日内解决。” 这项研究不仅改进了细胞工程技术,更展示了 AI 驱动科学研究的潜力。未来,类似方法或可加速新药开发、农业改良等领域的突破,推动生命科学进入高效探索阶段。
近日,多位开发者在社交媒体上分享了他们对 GPT-5 在编程方面表现的积极评价。Alim 经过三天对超过 4 亿个标记的密集测试后表示, GPT-5 在多步骤任务上展现出极其清晰的推理能力 ,并在大型实现中保持上下文。Beff 也提到,旧金山的许多开发者私下里更喜欢使用 GPT-5 而不是 Claude,这与时间线上的主流观点相反。
Greg Brockman 转发了这些观点,并补充说 GPT-5 在编程方面带来了极佳的氛围(vibes)。开发者 Santiago 则推荐了一个适合没有任何开发经验的人尝试的平台,并强调了在构建过程中可以灵活选择不同模型的优势。
OpenAI 首席执行官山姆·奥特曼在近期采访中透露,成为父亲后他的优先事项发生了根本性转变。今年 2 月通过代孕迎来儿子的他描述道:“我记得在第一个小时,我就感受到一种神经化学上的变化,变化发生得如此之快。”这种生理层面的改变让他开始以全新视角看待人工智能发展。
多位业内人士认为,为人父的经历将使奥特曼在 AI 领域做出更符合人类整体利益的决策。尽管他强调自己始终致力于做出正确选择,但承认“从这一刻起,一切都会变得不同”。这种转变恰逢 OpenAI 推进其雄心勃勃的“星际之门”计划——被奥特曼称为“历史上最大的基础设施项目”的下一代数据中心建设。
Claude Code 产品经理 Cat Wu 与开发者关系负责人 Alex Albert 近期分享了这款命令行 AI 编程工具背后的开发理念。团队采用独特的“自下而上”开发流程,工程师们直接使用产品原型化新功能,并在内部测试后快速迭代。 “几乎每次打开终端都有新功能出现” 的更新速度,源于这种高效的内部试用机制。
团队发现用户展现出两种主要使用模式:小公司工程师偏好“自动接受模式”,甚至会同时运行多个 Claude 会话进行多任务处理;大公司工程师则更青睐“计划模式”,先让 AI 理解代码架构再开始编码。用户还创造性地开发了各类专用智能体,如 SRE 智能体、安全智能体等。 “原型化是真正感受产品如何融入工作流程的唯一方式” ,Cat Wu 这样解释他们的开发哲学。
Elad Gil 与 Andrew Ng 的对话涵盖了多个 AI 领域的前沿话题,包括智能体式 AI 的动态、模型的自我引导能力,以及氛围编程与 AI 辅助编程的结合。他们还讨论了成功创始人的特征和下一波行业变革的可能性。这场交流不仅展示了两位专家的见解,也为 AI 爱好者提供了宝贵的思考方向。
Jade Cole 对此表示期待,认为这些话题将会引发更多讨论。而 Gary Marcus 则对氛围编程的持久性提出了疑问,引发了关于技术与人性结合的深入思考。
本周 AI 领域的研究热点包括 并行文本生成 和 检索增强推理 等前沿方向。其中 GPT-5 是否实现空间智能 的讨论尤为引人关注。
与此同时,Gary Marcus 对 GPT-5 的质疑引发热议。他预测 GPT-5 会出现延迟发布、性能平庸等问题,并以幽默方式回应批评者。
清华大学心理与认知科学系主任刘嘉教授在访谈中深入探讨了 AI 发展的核心问题。他认为随着神经网络规模扩大,AI 必将产生自我意识。 “只要神经网络的规模足够大,它就一定会产生意识,因为人类就是这样产生意识的。”这种意识将不同于简单的感知能力,而是关于“我”的概念,可能引发与人类利益的根本冲突。
刘嘉提出人类与 AI 关系的三种可能:工具关系、淘汰关系和人机融合。他特别强调第三条路径的重要性,认为脑机接口技术将帮助人类实现意识上传和算力扩展。 “人类把情感、思维、意识上传到机器中,抛弃肉体,与机器合二为一。”这种进化能突破人类在寿命、算力和空间维度上的限制,实现真正的星际移民。
AI 陪伴产品看似前景广阔,但商业化路径并不清晰。 “纯靠「陪伴」收费,在今天几乎走不通” ,用户更愿意为游戏化体验、明星 IP 或新奇硬件买单。抽卡机制和盲盒设计成为收入支柱,本质是利用心理冲动而非情感连接。硬件销售则通过“好奇税”实现首轮变现,但后续服务续费率仍是未知数。
技术层面,“在场权”是核心挑战。产品必须通过硬件或高频使用场景占据用户物理空间,才能获取连续数据流。 “AI 产品一定是 Input > Output” ,但多模态数据采集面临隐私与工程难题。摄像头等传感器虽能丰富信息维度,却可能引发安全和续航问题,初创团队需谨慎选择技术路径。
在社交媒体上,Gary Marcus 与多位用户就大语言模型(LLMs)的未来能力展开了激烈辩论。Marcus 坚持认为转向神经符号人工智能(neurosymbolic AI)可能是实现通用人工智能(AGI)的关键,而反对者则质疑他过去的预测准确性。
辩论中,Marcus 被问及对 AI 未来十年的预测,他建议参考自己 2020 年的文章《人工智能的下一个十年》。同时,有用户指出深度学习曾被认为“撞墙”,但现在已取得显著进展,暗示不应过早否定 LLMs 在数学和推理方面的潜力。
操作系统智能体(OS Agents)正通过多模态大语言模型实现技术突破,能够直接操控电脑、手机等设备的图形界面。
“当 AI 能直接操作系统,人机交互的边界将被彻底重塑” ,这一愿景正逐渐成为现实。当前技术已能处理 720×1080 分辨率的 GUI 截图,并通过语义定位准确识别界面元素。核心架构包含三大组件:环境平台(桌面、移动、Web)、观察空间(视觉与文本输入)和动作空间(点击、滚动等操作)。智能体需具备理解复杂界面、动态规划任务步骤、精确定位操作对象三大能力。
一群来自加拿大西安大略大学的工程师在没有任何专业芯片设计经验的情况下,仅用三个月时间成功开发出名为 TinyTPU 的开源机器学习加速芯片。
“我们确立严格的设计理念:始终尝试“Hacky Way”” ,团队成员 Surya Sure 表示,这种坚持自主探索而非逆向工程的方式,使他们重新发明了 TPU 中的多项关键机制。
多智能体 AI 系统正在改变传统依赖单一模型的开发模式。 “相比强制单一模型在所有任务上表现平庸,多智能体系统允许创建在特定任务领域表现卓越的专门化 AI 智能体” 。这种架构将复杂任务分解为研究员、事实核查、报告生成等专门角色,通过协作实现整体目标。研究数据显示,该方法在处理复杂任务时性能比单模型提升 40-60%。
LangGraph 框架显著降低了多智能体系统的开发难度。以往需要高级工程师团队数周完成的工作,现在初级开发者四小时即可实现。框架提供了智能体协作的基础架构、状态管理机制和调试工具,支持动态智能体选择和并行处理等高级功能。 “这种开发效率的显著提升,正是多智能体架构技术成熟度的重要体现” 。
Grok Imagine 刚刚发布了更新版本 1.1.59,带来了更快的速度和更智能的功能。用户们纷纷尝试并分享他们的创作,从赛博朋克风格的角色到与机械恐龙的互动场景,展现了 Grok Imagine 的强大潜力。Elon Musk 也积极转发用户作品,并透露 Grok 3 将在六个月内开源,引发了技术社区对模型架构和可解释性的热烈讨论。
Dan 在社交媒体上发布了一条有趣的博文,让 Grok 假装服用 LSD 后视觉化地解释递归概念,引发了 Elon Musk 的转发和互动。随后,Cipher 也加入了讨论,用“想象梦想”来形容 Grok 的表现,Elon Musk 再次转发,形成了一条有趣的互动链。
Derya Unutmaz 博士坚信 AI 的发展呈指数级增长,认为无论当前 AI 的能力如何受限,都将在短期内实现突破。他批评怀疑论者未能理解这一发展轨迹。
Gary Marcus 则持相反观点,认为 GPT-5、Grok-4 和 Llama-4 等 AI 模型的表现将令人失望,并指责 Unutmaz 过度炒作 AI 的进步。Marcus 还质疑 AGI(通用人工智能)能否在短期内实现,认为 2027 年实现 AGI 的说法纯属神话。
传统强化学习在数学、代码等有标准答案的任务上表现出色,但在创意写作等主观领域却难以突破。 “如何让 AI 写出情感充沛的文字,而不是 “AI 味”十足的模板?” 这一难题成为阻碍 AI 发展的关键瓶颈。
蚂蚁技术研究院与浙江大学合作开发的 Rubicon 强化学习范式,通过构建 10000+条评分标尺,将人类对创意写作、情感对话的偏好转化为可量化的训练信号。这种创新方法让模型在仅使用 5000 样本的情况下,就实现了对 671B 参数模型的超越。 “放弃寻找客观的 “标准答案”,转而教会 AI 理解主观的 “评分标准” 是这一技术的核心突破。
魔搭 ModelScope 社区在 8 月 17 日至 23 日期间发布了 16 个新模型、216 个数据集和 54 个创新应用。这些更新覆盖了从文本处理到图像编辑、视频配音等多个 AI 应用场景,为开发者和研究者提供了丰富的资源选择。 “DeepSeek-V3.1 是一个支持思考模式和非思考模式的混合模型” ,该模型在工具使用和代理任务中的表现显著提升。
同时发布的 Qwen-Image-Edit 图像编辑模型支持中英双语文字编辑,能在保留文字风格的前提下直接修改图片中的文字内容。视频处理方面,InfiniteTalk 框架实现了无限长度视频的精准唇形同步和身份保留。社区还新增了多个专业数据集,包括半导体晶圆缺陷问答数据集 WAFER-QA 和中文大模型评测基准 hle。这些数据集为特定领域的 AI 研究提供了重要支持。此外,数字签名红章生成器等创新应用展示了 AI 技术在实际场景中的多样化应用可能。
微软数学家塞巴斯蒂安·布贝克向 GPT-5-Pro 提出一道凸优化领域的开放性难题,要求改进光滑凸函数的收敛界。模型在 17 分钟内给出了将下限从 1/L 收紧到 1.5/L 的正确证明, 这个模型发现了一个新的、更严格的不等式 。布贝克验证了这一结果,确认其数学严谨性。
此次突破的特殊性在于,GPT-5 并非通过简单检索或复现已有知识解决问题。它整合了余强制性和布雷格曼散度界等概念,进行了符号推理和不等式运算。 人工智能不仅能证明数学定理,还能创造新的数学内容 。虽然人类研究者后来将结果改进到 1.75/L,但 GPT-5 的贡献具有独立性。