技术自主,始于开源架构

作者: CBISMB

责任编辑: 贾西贝

来源: CBISMB

时间: 2026-07-22 10:55

关键字: AI 数据 Cloudera

浏览: 0

点赞: 0

收藏: 0

作者:Cloudera 首席技术官 Sergio Gago

在快速演进的科技格局中,越来越多专有技术供应商正主导企业使用数据和AI的方式,包括工具、标准及参与规则。少数厂商掌控全球技术的基础架构,也意味着将由这些厂商决定参与者、参与成本以及参与方式。

随着新兴的 AI 智能体(Agentic AI)经济时代到来,企业决策者不能将“租来的能力”当作永久的运营控制权。然而很多企业的 AI 战略已经本末倒置,将大量资源投入模型层,生成式工具视为AI的全部,仿佛 AI 从提示词开始,到提示词结束。

但事实并非如此,在争相部署这些技术的过程中,企业忽视了一个基本事实:AI 的起点不是模型,而是数据、架构和治理。如果这些基础能力是集中化、不透明且无法访问的,那么在此基础上构建的 AI 将出现同样的问题,并以更快的速度更大规模放大风险

开源是破解供应商锁定(Vendor Lock-in)和减小创新阻碍的重要途径,帮助企业无需依赖单一供应商,就能参与一个共享、民主的生态系统。

德勤在《技术趋势2026》中指出,2025年,企业普遍关注概念验证(PoC)和技术探索,而如今已经全面进入规模化生产阶段,企业开始更加关注如何通过AI推动自动化、创新和业务增长,而不仅仅是部署模型本身。 对于希望打造可靠的生产级企业系统,而非仅停留在演示阶段的企业而言,领导者必须意识到真正的技术自主建立在互操作性、数字主权与private AI之上。

互操作性即选择自由

互操作性是企业数据战略的核心,也是避免被单一供应商锁定的关键。互操作性能够帮助企业在替换某一组件的时候无需重建整个系统,也无需将所有数据集中到单一位置或单一供应商处。基于专有数据格式、专有编排机制和专有云接口运行的开放模型,本质仍然是一个封闭系统。当任何单一提供商都能单方面设置访问条件或改变定价时,企业运营的灵活性就会受到影响。

一家医院应该能够使用一套存储系统、另一套分析引擎以及适配本地的 AI 模型,同时无需将敏感的患者数据复制到专有的数据孤岛之中。一个政府机构应该能够在无需重建关键公共服务的情况下更换技术供应商。任何地方的研究人员都应能使用开放格式和接口,并使其无缝适配到本地语言、本地数据和本地需求中。

采用Iceberg 等开放表格式、开放引擎与目录(例如Polaris)、开源计算引擎与 API,以及统一的治理策略,支持多学科团队能够基于同一套受治理的数据开展协作,而无需强制进行复制操作,也无需为释放价值而将数据迁移至单一供应商。所以,这种方式也会更有利于降低成本。随着结构化和非结构化数据量的不断增长,企业需要灵活地在数据所在的复杂环境中选择并运行各类模型。这一关键选择,可以防止当前的采购决定变成长期依赖。

数字主权是业务连续性的前提

数字主权(digital sovereignty)已不仅仅是高度受监管行业的政策要求,而是正逐渐成为任何一家具备韧性的企业需要满足的运营要求。

AI 正成为公共管理、医疗、教育、国防和金融等领域的重要基础。事实上,这项技术本身正在转变为关键基础设施。随着 AI 融入核心业务流程,企业能否利用好AI将决定其业务能否持续运转。

完全依赖外部公有云或闭源黑箱(black boxes)模型将为企业带来巨大的运营风险。第三方提供商可能突然调整 token 定价、修改许可协议、停用模型或调整服务条款。地缘政治变化与合规要求可能会在一夜之间令企业的访问权限受限。

越来越多的企业,甚至整个国家,都想用自己无法掌握的能力来构建业务体系。无论决策是出自董事会、监管机构,还是源自地缘政治冲突,其运营结果都可能都是访问权限的丢失。而一个原以为买下了某项技术能力的企业,会发现自己只是租用了使用许可。

因此, AI 主权战略需要能够回答以下问题:

  1. 数据储存在什么位置?
  2. 谁可以访问这些数据,以及如何访问?
  3. 哪些模型可以使用这些数据?
  4. 能否迁移工作负载?
  5. 能否即时替换模型?
  6. 能否审计和检查系统?
  7. 更重要的是,如果服务供应商改变了其商业或政治立场,企业能否继续运营?

数字主权并不意味着孤立,而是指企业能够在参与全球生态系统的同时,不放弃对核心能力的控制。所以,企业需要具备混合部署的能力,能够在公有云、私有数据中心或边缘环境无缝执行工作负载,从而确保运营路线始终受到自身的管控。

Private AI 是履行运营责任的前提

企业如果想在保护知识产权的前提下从专有数据中获得竞争优势,就需要采用基础开放、运行私密、结果可追溯的Private AI 框架。企业应该将计算能力直接部署到受管控的数据上,不是持续将海量数据集迁移至外部 AI 应用中。在可验证、可信的环境中运行模型,支持企业在完整生命周期内实施一致的安全措施、身份访问管理和数据溯源控制。

这种方法减小了从试点项目加速转向生产与获得可靠洞察之间的差距。

作为推动这一趋势发展的的重要参与者,Cloudera通过在 30 多个开源项目中保持超过 200 个提交者与贡献者席位,积极倡导这开放未来。通过基于 Apache Iceberg 等开放数据标准构建真正意义上的混合平台,Cloudera 确保企业数据与 AI 基础设施始终保持灵活、可移植,并处于企业的控制之下。

从演示迈向落地

市场上充斥着令人印象深刻的技术演示。然而,真正的企业价值并不由这些演示创造,而是来源于那些能够在周一早晨稳定运行、保护敏感资产并在周五下午通过严格审计的韧性系统。

  • 互操作性、主权与Private AI三者密不可分。
  • 互操作性使得替换成为可能。
  • 数字主权使得决策成为可能。
  • Private AI使得可控运营成为可能。

负责任的部署需要身份与访问控制、数据溯源、评估、偏见和安全测试、红队测试工具(red-teaming tools)、持续监控、透明的事件报告、审计日志、人工监督、申诉机制,以及关闭系统的能力,这些能力都应当成为数字公共产品。这一共享的安全层,很可能是当今 AI 生态系统中最重要的部分。

通过将 AI 战略建立在混合灵活性、开放数据架构与主权控制之上,企业领导者能够构建起可扩展的基础,在降低风险的同时推动可量化的业绩增长。我们相信,开源不仅降低 AI 的成本,还将使 AI 更具可竞争力、适应性更强、更能贴近本地需求,并值得信赖。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。