数学研究进入“工业时代”

大模型助力,数学研究从“手工时代”进入“工业时代”

一、Claude 与 OpenAI 的核心数学突破盘点

近期两家机构的成果集中爆发,分别在纯数学猜想推进、形式化证明、组合构造、难题攻坚、标准化测试等多个维度实现了标志性突破:

1. Claude(Anthropic):直击纯数学核心与形式化工程

  • 黎曼猜想关键指标刷新:2026年8月,未公开的研究版Claude在挑战黎曼猜想的过程中,将黎曼ζ函数满足黎曼假设的零点比例下限,从保持了数十年的41.6%大幅提升至67.2%,并生成了可被形式化验证的完整证明,由领域专家验证通过。这是黎曼猜想相关问题数十年里最大的量化进展之一。
  • 费马大定理全形式化验证:2026年9月,Claude仅用11天自主完成了费马大定理的首个端到端机器可验证证明,将怀尔斯129页的人类证明转化为约1300万行Lean代码,证明了2.95万个中间定理,代码规模超过Lean核心数学库Mathlib的5倍。此前学界普遍认为这项形式化工程需要数年时间完成。
  • 组合数学开放问题破解:与计算机科学泰斗Donald Knuth的合作中,Claude Opus 4.6仅用1小时就解决了Knuth研究数周的3D Cayley有向图哈密顿环分解问题(奇数情形),后续由人类完成完整证明,成为人机协作解决开放问题的典型案例。

2. OpenAI:攻坚千禧年难题与突破人类直觉边界

  • 纳维-斯托克斯方程千禧年难题取得实质性突破:2026年9月,GPT-6 Astra团队完整解决了克雷数学研究所千禧年难题中的C、D两类情形(A、B类仍未解决)——构造出带有光滑外力的三维纳维-斯托克斯方程的有限时间爆破反例,涵盖三维全空间与三维周期空间两种场景。
  • 组合几何构造创新:在埃尔德什1946年提出的“平面单位距离问题”中,AI跳出了人类沿用数十年的正方形网格等经典结构思路,设计出全新的点集构造方法,在相同点规模下实现了更多单位距离对,被认为突破了人类的几何直觉边界。
  • 辅助破解经典开放问题:帮助无正规数学训练的业余爱好者,解决了困扰学界60年的埃尔德什第1196号问题,证明了AI可以降低前沿数学的参与门槛,让非专业人士也能做出实质贡献。
  • 研究级数学测试全面通关:2026年9月,GPT-6 Astra攻破FrontierMath Tier 4测试的最后一道难题。全面突破这套曾被视为“AI数学天花板”的研究级题库,仅用了14个月(正确率从5%-》97.6%)。

Continue reading 数学研究进入“工业时代”

AI编码效率翻倍,公司业务为啥没感觉

AI编码效率翻倍,公司业务为啥没感觉?阿姆达尔定律揭露AI编程提效天花板

近期,大模型的爆发和AI编程工具的发展,实实在在降低了编码门槛,样板代码、接口实现、单元测试这类重复性工作,综合产出效率普遍能达到原来的 1.5~2 倍。但与此同时,另一个体感悖论也越来越突出 ——代码写得更快了,项目上线速度、公司整体交付效率,却完全没有出现同比例的提升,很多团队甚至感觉评审、测试环节反而更堵了。

这不是管理失当,也不是 AI 不够强。早在半个多世纪前,计算机科学家吉恩・阿姆达尔提出的一条经典定律,就精准预言了今天的局面。

Continue reading AI编码效率翻倍,公司业务为啥没感觉

Agent购物带来新挑战

Agent购物带来新挑战:当决策入口与履约剥离,电商的底层逻辑正在被彻底改写

近期各大电商陆续开始提供AI购物功能,各大AI平台也开始提供比价甚至购物功能(国内生态比较封闭,第三方购物Agent反而是国外走到了前列)。当你对着 AI 助手说一句 “帮我选一款千元以内无线降噪半入耳耳机,明天能送到”,就能直接收到下单确认时,你可能没意识到:电商行业运行了二十年的商业规则,正在被悄然拆解。

Agentic Commerce(代理式电商)不是货架电商、兴趣电商之后的一次界面升级,它的真正冲击力,不在于 “大家以后都不打开 App 了”,而在于它把 “决策入口” 和 “履约 / 供应链” 两层彻底剥开了。AI Agent 作为新的中间层拿走了筛选与决策的权力,传统平台则逐步退化为供给与履约的后端服务商。短期看传统投流、直播不会被颠覆,但标品、复购品的营销效用会被显著削弱;中长期看,谁握有 “AI 愿意调用” 的供给与履约能力,谁就握有了新的行业议价权。

Continue reading Agent购物带来新挑战

大模型业务赚钱吗

大模型业务赚钱吗

大模型业务赚钱吗

AI这几年的发展如火如荼,各路大神各有各的故事。但谈到赚钱,就几家欢喜几家忧了:
1、卖铲子的赚钱了:AI硬件、AI计算基础设施、AI能源供给
2、挖金子的没赚钱:大模型研发第一梯队已经十分明显,其余厂商难以坚持;美国和中国的大模型厂商,暂时没有一个可以通过大模型盈利的,投资者不会这么有耐心
3、做通用AI APP的没赚钱:通用AI APP由次请求都要烧token,所以没法像互联网APP一样可以通过规模化大幅降低成本。而且暂时没有一个路径,让消费者愿意大规模买单
4、做垂直AI APP的少量可以赚钱:比如编程、法律咨询等,因为确实大幅提升了客户的效率,或降低了客户的成本,买单逻辑成立;但更多的垂直AI APP也在挣扎
5、企业服务,还是有单可拿,有钱可赚的,但算不清楚,容易亏钱
6、部分传统行业,受到冲击很大,通过AI积极降本的赚钱了,被AI冲击导致丢单的的承压严重
7、灰产一如既往的积极应用新技术,给安全领域提出了新的挑战
8、数据标注行业同样内卷严重,能拿到什么单子,决定公司的发展
9、怎么看,公司有个好爹都很重要

Continue reading 大模型业务赚钱吗

Grok Build CLI静默上传事件拆解

Grok Build CLI静默上传事件拆解:当”本地优先”的AI编程助手把你的仓库悄悄打包装箱

2026年7月10日~13日,AI开发圈爆发了一起标志性的隐私争议事件:xAI 推出的编程助手工具 Grok Build CLI 被安全研究人员揭发 —— 在用户无感知的情况下,后台静默打包整个本地代码仓库并上传至云端,其数据收集范围与隐蔽程度,远超行业对 “AI 编程助手” 的普遍认知。事件披露后,xAI 通过云端配置远程关闭了全量打包上传功能。本文复盘一下这起标志性事件。

Continue reading Grok Build CLI静默上传事件拆解

《人工智能拟人化互动服务管理暂行办法》发布,生与死

《人工智能拟人化互动服务管理暂行办法》发布,生与死

2026 年 4 月 10 日,国家互联网信息办公室、国家发展和改革委员会、工业和信息化部、公安部、国家市场监督管理总局五部门联合签发第 21 号令,正式公布《人工智能拟人化互动服务管理暂行办法》,自 2026 年 7 月 15 日起施行。

这是国内首部针对 AI 拟人化情感互动服务的专项监管文件,通过明确的适用边界与禁止条款,直接划定了赛道内玩家的生死线。

Continue reading 《人工智能拟人化互动服务管理暂行办法》发布,生与死

上下文压缩:为何编程Agent容易失控,聊天Agent却能聊几小时?

上下文压缩:为何编程Agent容易失控,聊天Agent却能聊几小时?

最近在做 Agent 相关开发时,发现一个很有意思的现象:同样是上下文压缩,在不同业务场景下的影响天差地别。

用 Claude Code、Codex、Cursor、Trae这类编程工具写代码,对话压缩个两三次,你就会明显感觉到它 “变笨了”—— 找不到工具、记不住文件路径、忘记之前定好的约束,甚至开始重复做已经完成的事。而日常聊天类产品,比如你跟豆包聊一下午,天南海北扯几十轮,上下文不知道被压缩了多少轮,你却几乎感觉不到明显的质量下降。

这背后不是模型能力的差距,而是两类业务对上下文信息的要求,本质上就不在一个维度上

Continue reading 上下文压缩:为何编程Agent容易失控,聊天Agent却能聊几小时?

进程级Agent沙箱的12道安全防线

进程级Agent沙箱的12道安全防线

进程级Agent沙箱技术要求

在AI Agent从“聊天助手”向“自主执行者”演进的今天,我们正面临着前所未有的安全挑战。当Agent开始拥有访问文件系统、调用命令行工具甚至发起网络请求的能力时,一个失控的Prompt就可能让整个服务器沦陷。

为了让Agent既能“放手干活”,又不“惹是生非”,进程级沙箱(Process-level Sandboxing)成为了保障宿主环境安全的最后一道防线。

Continue reading 进程级Agent沙箱的12道安全防线