Kingston
在线实验系统

Kingston实验室

金融 AI 想法面临的地方 实际运行压力。

基准、代理系统、即时实验和工作流程原型——在最有力的想法成为 Kingston 的一部分之前进行公开测试。

提出测试
实验室遥测直播队列
活跃的实验室轨道08
评估阶段05
发布情报流01

思想如何流动

并非每个实验都应该成为产品。

实验室让不确定性变得可见。每个想法都会经历一个清晰的阶段,因此访问者可以将早期探索与已发布和可用的东西区分开来。

01

实验

测试问题并定义有用的证据是什么样的。

02

原型

将想法转化为工作交互或受控工作流程。

03

测试

挑战财务任务的可靠性、有用性和失败条件。

04

发布

将最强的信号移入Kingston,具有明确的操作目的。

Experiment queue

Inspect what is moving through the lab.

LAB / 01测试

Model benchmarks

模型基准:财务文件问答

比较每个模型如何针对一组共享的财务文档回答直接问题。

Evaluation in progress
LAB / 02原型

AI agents

多智能体研究助理

将研究问题拆分到多个模型并协调结果的原型。

Evaluation in progress
LAB / 03实验

Prompt experiments

风险备忘录的提示链接

测试连锁的、较窄的提示是否会比一个大的提示产生更可靠的风险备忘录。

Evaluation in progress
LAB / 04贝塔

Beta tools

Kingston 副驾驶

AI 助手,端到端运行 Kingston 工作流程并保持步骤井井有条。

Evaluation in progress
LAB / 05贝塔

Beta tools

Kingston 仪表板

统一的工作空间展示模型比较、活动工作流程和研究更新。

Evaluation in progress
LAB / 06测试

Community testing

社区提示测试池

社区成员在将草稿提示添加到库之前测试草稿提示的共享池。

Evaluation in progress
LAB / 07原型

Prototype workflows

工作流程自动建议

根据任务的简短描述建议最相关的 Kingston 工作流程。

Evaluation in progress
LAB / 08已发布

Research notes

每周模型基准注释

简短、注明日期的注释跟踪模型更新如何改变财务任务的绩效。

Evaluation in progress

将财务-AI 索赔置于压力之下

提出问题。 Kingston 实验室将帮助制定测试。

提出一个实验室实验