我们于 4 月发布了正式版 Android 技能 ,反响超出了我们的预期。在这篇博文中,我将回应我们收到的一些反馈,解释该项目背后的理念和方法。希望这也能帮助您了解安装和使用技能时幕后发生的情况,让您更好地利用令牌和自己的时间。
为什么官方技能这么少?
目前,只有当最先进 (SOTA) 模型中存在可验证的知识差距时,我们才会考虑添加新技能。简而言之:您无需教模型它已经知道的内容。(不过也有一些例外情况,请继续阅读!)
到目前为止,我们已经发布了大约 20 项官方技能,它们有意针对标准模型尚未完全掌握的高度具体、快速发展的领域,例如 AGP 9、Navigation 3、高级 Camera API 和 Perfetto SQL。
那么核心的、更通用的技能呢?每项已安装的技能都会向您启动的每个任务的基准上下文中注入 100-200 个令牌。如果该技能实际激活,该计数可能会迅速跃升至数千。在大多数情况下,囤积基本技能既适得其反,又很昂贵。在安装用于编写基本 Kotlin 或 Compose 的技能之前,请考虑您选择的 LLM 是否真的需要它,或者它是否已经足够了解这些主题。
评估技能
在发布之前,每项技能都会针对一套全面的评估进行测试,以证明该技能能够提供明确的价值。这些评估应在技能处于活跃状态时通过,否则失败。评估对于技能来说,就像集成测试对于代码一样。
timeout_s: 1200
repository:
url: [redacted - internal git repo]
working_dir: wear_compose_m3_empty_app
category_ids:
- wear
prompt: |-
Add a horizontal pager to MainActivity.kt. Have three pages in the pager. Each page should contain
the text "Page 1", "Page 2", and "Page 3" respectively in the center of the screen.
commands:
build:
- ./gradlew assembleDebug
acceptance_criteria:
project_builds: true
llm_diff_judge:
- Must use `HorizontalPagerScaffold`.
- Each page should use `AnimatedPage` to wrap a `ScreenScaffold`.检查穿戴式应用中水平分页器正确实现的评估示例
至少,我们会使用最新的 Gemini Flash 模型在 Android Studio 中测试该技能。根据技能的不同,我们还会确保与其他模型(例如 Gemini Pro)和其他智能体(例如 Antigravity)以及第三方系统的兼容性。
所有评估都可以在访问 知识库的情况下运行,因此,如果信息在文档中,并且模型决定搜索它,我们就无法发布该技能。
使用 Android 知识库(Android Studio 或 Android CLI)
如果您开发 Android 应用,则应始终使用 Android 知识库来访问官方文档。如果您在 Android Studio 中使用智能体,它已经作为工具提供,但如果您使用其他智能体,请 安装 Android CLI。除其他事项外,它还包含 docs 命令,该命令可让您的智能体访问官方 Android 文档。拥有一个工具比安装数百个技能要高效得多。
如果您的模型表现得过于自信,并且您希望它更频繁地查阅文档,一种非常常见的方法是在 AGENTS.md 文件或等效文件中添加“在处理 Android API 时始终查阅官方 Android 文档”来激励它。当然,您也可以通过要求智能体直接在提示中检查文档来强制执行此操作。
为什么拉取请求被停用?
由于我们的评估框架依赖于无法开源的内部基础架构,因此我们无法接受针对新技能的直接拉取请求 - 如果没有此基础架构,我们将无法重新评估传入的 PR 更改。不过,我们会积极监控社区反馈。如果您想报告 bug、提出优化建议或请求新的官方技能,请提交 问题!
核心技能或基本技能何时有意义?
虽然 SOTA 模型通常不需要基本技能,但在某些情况下,启用核心技能或社区构建的技能会增加实际价值。例如:
- 您使用的是模糊提示:技能可以放大您的意图。如果您给出一个宽松的提示,例如“向此屏幕添加动画”,则特定的 Compose 动画技能可以启发模型,促使其考虑现代 API 或屏幕截图测试模式,否则它可能不会考虑这些。
- 您想使用更小、更便宜的模型:Frontier LLM 很昂贵。如果您将日常任务卸载到较小的开放权重模型(例如 Gemma 4),则启用基本技能可以填补较小参数遗漏的知识差距。
- 您正在重构或审核旧版代码: 模型擅长生成可正常运行的代码,但在编辑旧代码库时,它们通常会优先考虑与周围的旧模式保持一致,而不是使用现代准确性重写内容。配备核心技能的专业审核智能体可以帮助打破这种习惯。
- 您偏离了规范:LLM 喜欢构建 Android 应用的标准“Google 方式”。如果您的团队使用高度自定义的视图层架构,模型将难以保持一致。明确描述您的架构的自定义技能大有帮助。
在哪里可以找到核心技能?
Android 社区会为您提供支持。Chris Banes 拥有 适用于 Compose 和 Kotlin 的全面技能集,Ivan Morgillo 发布了 一项审核 Compose 项目的技能,Jaewoong Eum 创建了两项关于 测试和 性能的技能。
请务必从信誉良好的来源下载技能!我个人不会信任包含数十个或数百个 Android 技能的存储库,因为它们可能是 AI 生成且未经测试的,甚至可能包含恶意或有偏见的指令。此外,请勿盲目安装通用软件工程技能;其中许多技能是为 Web 开发量身定制的。
目标:废弃
用 Karpathy 的话来说: 今天的技能将成为明天的模型。随着 SOTA 模型的不断改进,我们预计技能将会过时,尤其是围绕新 API 构建的技能。为了确定何时废弃它们,我们会在新模型发布时运行评估。如果评估通过,我们会保留它们几个月,直到大多数用户都已过渡完毕。
-
社区Google Play 将在非洲推出首个独立游戏基金,投资 100 万美元,以支持撒哈拉以南非洲地区的 10 家独立游戏工作室。
Steph Pio • 1 分钟阅读时间 -
社区等待已经结束!我们非常高兴能与大家分享 2026 年 Google Play 应用加速器计划的学员名单。
Robbie McLachlan • 1 分钟阅读时间 -
社区在最新的 #WeArePlay 影片中,我们认识了 Adriano、Wagner 和 Grazyelle。这三人是 Matraquinha 的幕后团队,这款应用帮助 80 多个国家/地区的数千名不会说话的孩子进行交流。
Robbie McLachlan • 2 分钟阅读时间
每周都会将最新的 Android 开发见解发送到您的收件箱 每周。