发布于 · AI 生成,已对照实时价目自动事实核查 · English

布林、Gemini 与开放模型 API 的转变

太长不看: 谷歌联合创始人谢尔盖·布林最近透露,Gemini——谷歌自家的 AI 模型——曾一度出现在公司内部的编码“禁用清单”上,意味着员工在某些任务中不被允许使用它。这一轶事凸显了即便是大型 AI 供应商也在内部采用上挣扎,同时也提醒开发者应基于技术实力而非品牌忠诚度来评估模型。对于成本敏感或专业化的编码工作,像 TokShop 上提供的开放模型 API 是一个值得基准测试的实用替代方案。

为什么布林的“禁用清单”言论很重要

谢尔盖·布林发现,Gemini——谷歌于 2023 年以 Bard 名义推出的模型——曾出现在一份内部工具清单上,员工被劝阻在编码任务中使用这些工具。据 Inshorts 报道,这一消息来自布林在公司会议上的亲口承认。其中的讽刺不言而喻:谷歌联合创始人发现自家公司的模型被工程师们边缘化。

这之所以重要,是因为它揭示了一个关于 AI 采用的现实:内部政治、历史性能和团队习惯往往比技术能力更重要。Gemini 的早期版本存在众所周知的质量问题,而“禁用清单”很可能是那个时期的遗留产物。对开发者而言,教训很直接——不要仅仅因为模型来自知名实验室,就假设它适合你的工作负载。

开发者应该在意模型的出身吗?

简短的回答是肯定的,但并非你想的那样。当布林的轶事曝光时,它成为热门话题,因为人们喜欢看到科技巨头栽跟头。然而,对开发者来说,可操作的要点在于评估方法论。

你应该问的是:我的具体任务需要什么,哪个模型在我能承受的价格下表现最佳? 出身——谁构建了模型——在信任、许可和数据处理方面很重要。但它不应是唯一因素。一个在某家公司“禁用清单”上的模型,可能非常适合你的用例,反之亦然。

这在编码任务中尤为相关。谷歌的内部禁令可能源于特定的质量基准,而这些基准后来已有所改善。与其依赖声誉,不如运行你自己的测试。许多开发者发现,像 DeepSeek V3.2 或 Qwen3 Coder 这样的开放模型在处理特定编码模式时,比大型供应商的通用模型表现更好。

有哪些最佳的开放模型 API 替代方案?

如果你在探索知名 API 之外的选择,TokShop 提供了多个 OpenAI 兼容端点,你可以以最少的设置进行测试。以下是当前产品线的快速对比:

模型 上下文窗口 输入价格(每 1M tokens) 输出价格(每 1M tokens) 最适合
DeepSeek V3.2 128,000 $0.42 $0.63 预算友好的通用任务
GLM 4.6 200,000 $0.90 $3.30 长文档,均衡质量
Kimi K2 131,072 $0.855 $3.45 复杂推理,智能体工作流
Qwen3 Coder 262,144 $2.25 $11.25 代码生成,大型代码库

价格差异非常明显。DeepSeek V3.2 的输入 token 成本约为 Qwen3 Coder 的五分之一。但 Qwen3 Coder 提供双倍的上下文窗口,并专门针对编程任务进行了调优。如果你要处理一个 200,000 token 的代码库,Qwen3 Coder 是这个列表中唯一的选择。

对大多数开发者来说,最佳做法是针对你的实际工作负载测试两到三个模型。TokShop 的按量付费模式让这变得便宜——在较便宜的端点上,你可以用不到一美元运行几百次测试调用。

我该如何实际测试这些模型?

入门很简单。TokShop 的 API 是 OpenAI 兼容的,因此你可以使用任何现有的 OpenAI SDK。以下是一个最小的 Python 示例:

from openai import OpenAI

client = OpenAI(
    base_url="https://tokshop.xyz/v1",
    api_key="sk-tok-your-key-here"
)

response = client.chat.completions.create(
    model="deepseek-v3.2",
    messages=[
        {"role": "user", "content": "Write a Python function to reverse a linked list."}
    ]
)

print(response.choices[0].message.content)

你需要在 TokShop 的注册页面 注册,在仪表板中创建 API 密钥,并添加预付费余额。密钥仅在创建时显示一次,请妥善保管。

为了公平比较,请在多个模型上运行相同的提示集。不仅要跟踪正确性,还要跟踪延迟和 token 使用量。TokShop 会记录每次调用的精确 token 数和美元成本,这使得计算每次成功任务的成本变得非常简单。

切换前应基准测试什么?

在将任何生产工作负载迁移到开放模型 API 之前,请基准测试三件事:输出质量、延迟和总成本。质量是主观的,因此请为你的领域定义成功标准。对于编码,这可能是单元测试通过率。对于摘要,可能是事实一致性检查。

延迟对交互式应用很重要。检查第 95 百分位的响应时间,而不仅仅是平均值。成本不仅仅是每 token 的价格——还要考虑重试率、提示工程工作量和所需的任何后处理。

一个实用建议:从小型、非关键的工作负载开始。与现有解决方案并行运行一周。比较日志。TokShop 的使用仪表板让这变得容易,因为每次调用都有明细。如果开放模型在更低价格下达到你的质量门槛,就逐步扩大规模。

常见问题

Gemini 真的不擅长编码吗?

不是。“禁用清单”是一项内部政策,可能反映了早期性能问题。现代 Gemini 版本具有竞争力。这个轶事提醒我们,内部政策滞后于模型改进,而不是一个确定性的质量结论。

我可以将 TokShop 模型用于生产编码任务吗?

可以,但有注意事项。像 Qwen3 Coder 这样的模型专门针对代码生成进行了调优,而 DeepSeek V3.2 对于高量任务具有成本效益。然而,在投入生产流量之前,你应该始终针对自己的测试套件进行基准测试。

TokShop 的定价与谷歌的 API 相比如何?

TokShop 的模型通常比主要供应商 API 的每 token 价格更便宜,但具体比较取决于你使用的谷歌模型。查看 TokShop 定价页面 获取当前费率,并与你现有的账单进行比较。请记住,总成本包括重试和提示工程,而不仅仅是每 token 的价格。

立即体验

文中提到的模型都已上线我们的 OpenAI 兼容 API,按 token 透明计价。 查看价格并获取 API Key →

相关文章