Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
13 changes: 3 additions & 10 deletions app/(main)/evaluations/page.tsx
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,7 @@ import { FeatureGateModal, LoginModal } from "@/app/components/auth";
import { Loader, TabNavigation } from "@/app/components/ui";
import { useToast } from "@/app/hooks/useToast";
import { DatasetsTab, EvaluationsTab } from "@/app/components/evaluations";
import { RunMode, Tab } from "@/app/lib/types/evaluation";
import { Tab } from "@/app/lib/types/evaluation";

const leftPanelWidth = 450;

Expand Down Expand Up @@ -62,7 +62,6 @@ function SimplifiedEvalContent() {
},
);
const [isEvaluating, setIsEvaluating] = useState(false);
const [runMode, setRunMode] = useState<RunMode>("batch");
const [nameError, setNameError] = useState<string>("");
const [submitError, setSubmitError] = useState<string>("");

Expand Down Expand Up @@ -223,14 +222,11 @@ function SimplifiedEvalContent() {

setIsEvaluating(true);
try {
// `run_mode` is only sent when "fast" — omitting it means the backend
// defaults to batch, which is the safe behaviour for older clients too.
const payload: Record<string, unknown> = {
dataset_id: parseInt(selectedDatasetId),
experiment_name: experimentName.trim(),
config_id: selectedConfigId,
config_version: selectedConfigVersion,
run_mode: runMode === "fast" ? "fast" : "batch",
};

await apiFetch("/api/evaluations", apiKey, {
Expand All @@ -243,7 +239,6 @@ function SimplifiedEvalContent() {
setSelectedDatasetId("");
setSelectedConfigId("");
setSelectedConfigVersion(0);
setRunMode("batch");
toast.success(`Evaluation created!`);
return true;
} catch (error: unknown) {
Expand All @@ -254,12 +249,12 @@ function SimplifiedEvalContent() {
break;
case "config_type_unsupported":
setSubmitError(
"Fast mode only supports text-evaluation configs. Pick a text config or switch to Batch.",
"This evaluation only supports text-evaluation configs. Pick a text config to continue.",
);
break;
case "dataset_too_large_for_fast":
setSubmitError(
"This dataset is too large for Fast mode (limit is ~10 unique rows / 50 items). Pick a smaller dataset or switch to Batch.",
"This dataset is too large for evaluation (limit is 500 items). Pick a smaller dataset.",
);
break;
default:
Expand Down Expand Up @@ -349,8 +344,6 @@ function SimplifiedEvalContent() {
isEvaluating={isEvaluating}
handleRunEvaluation={handleRunEvaluation}
setActiveTab={setActiveTab}
runMode={runMode}
setRunMode={setRunMode}
nameError={nameError}
submitError={submitError}
/>
Expand Down
18 changes: 3 additions & 15 deletions app/components/evaluations/EvaluationsTab.tsx
Original file line number Diff line number Diff line change
Expand Up @@ -3,12 +3,7 @@
import { useState, useEffect, useCallback } from "react";
import { apiFetch } from "@/app/lib/apiClient";
import { Dataset } from "@/app/lib/types/dataset";
import {
AssistantConfig,
EvalJob,
RunMode,
Tab,
} from "@/app/lib/types/evaluation";
import { AssistantConfig, EvalJob, Tab } from "@/app/lib/types/evaluation";
import { useAuth } from "@/app/lib/context/AuthContext";
import { Modal } from "@/app/components/ui";
import EvalRunsList from "./EvalRunsList";
Expand All @@ -28,8 +23,6 @@ export interface EvaluationsTabProps {
isEvaluating: boolean;
handleRunEvaluation: () => Promise<boolean>;
setActiveTab: (tab: Tab) => void;
runMode: RunMode;
setRunMode: (mode: RunMode) => void;
nameError?: string;
submitError?: string;
}
Expand All @@ -48,8 +41,6 @@ export default function EvaluationsTab({
isEvaluating,
handleRunEvaluation,
setActiveTab,
runMode,
setRunMode,
nameError,
submitError,
}: EvaluationsTabProps) {
Expand All @@ -65,15 +56,14 @@ export default function EvaluationsTab({
const selectedDataset = storedDatasets.find(
(d) => d.dataset_id.toString() === selectedDatasetId,
);
const fastModeMismatch =
runMode === "fast" && selectedDataset?.eligible_for_fast === false;
const datasetTooLarge = selectedDataset?.eligible_for_fast === false;
const canRun = Boolean(
experimentName.trim() &&
selectedDatasetId &&
selectedConfigId &&
selectedConfigVersion &&
!isEvaluating &&
!fastModeMismatch,
!datasetTooLarge,
);

const { isAuthenticated } = useAuth();
Expand Down Expand Up @@ -158,8 +148,6 @@ export default function EvaluationsTab({
canRun,
onRun: handleRun,
setActiveTab,
runMode,
setRunMode,
nameError,
submitError,
};
Expand Down
63 changes: 8 additions & 55 deletions app/components/evaluations/RunEvaluationForm.tsx
Original file line number Diff line number Diff line change
@@ -1,17 +1,11 @@
"use client";

import { Dataset } from "@/app/lib/types/dataset";
import {
Button,
Field,
InfoTooltip,
RadioGroup,
Select,
} from "@/app/components/ui";
import { Button, Field, Select } from "@/app/components/ui";
import { CheckCircleIcon, PlayIcon } from "@/app/components/icons";
import ConfigSelector from "@/app/components/ConfigSelector";
import EvalDatasetDescription from "./EvalDatasetDescription";
import { RunMode, Tab } from "@/app/lib/types/evaluation";
import { Tab } from "@/app/lib/types/evaluation";
import { MAX_NAME_LENGTH } from "@/app/lib/constants";

interface RunEvaluationFormProps {
Expand All @@ -28,8 +22,6 @@ interface RunEvaluationFormProps {
canRun: boolean;
onRun: () => void;
setActiveTab: (tab: Tab) => void;
runMode: RunMode;
setRunMode: (mode: RunMode) => void;
nameError?: string;
submitError?: string;
}
Expand All @@ -48,12 +40,10 @@ export default function RunEvaluationForm({
canRun,
onRun,
setActiveTab,
runMode,
setRunMode,
nameError,
submitError,
}: RunEvaluationFormProps) {
const fastEligible = selectedDataset?.eligible_for_fast !== false;
const datasetEligible = selectedDataset?.eligible_for_fast !== false;

return (
<div className="flex-1 overflow-auto p-4 space-y-4">
Expand Down Expand Up @@ -140,48 +130,11 @@ export default function RunEvaluationForm({
</div>
)}

<div>
<label className="inline-flex items-center text-xs font-medium mb-1.5 text-text-secondary">
Run Mode
<InfoTooltip
text={
<>
<strong>Batch</strong> — the standard mode. Runs every item in
the dataset and produces full metrics.
<br />
<br />
<strong>Fast</strong> — short-loop mode for quick iteration.
Only works on small datasets (≤10 unique rows / ≤50 items) and
text-evaluation configs.
</>
}
/>
</label>
<RadioGroup<RunMode>
ariaLabel="Run mode"
className="ml-4"
value={runMode}
onChange={setRunMode}
disabled={isEvaluating}
options={[
{ value: "batch", label: "Batch" },
{
value: "fast",
label: "Fast",
title:
selectedDataset && !fastEligible
? "This dataset is too large for Fast mode — pick a smaller one"
: undefined,
},
]}
/>
{selectedDataset && !fastEligible && (
<p className="text-xs mt-1.5 text-status-error-text">
Fast mode isn&apos;t available for this dataset — pick a smaller one
or stay on Batch.
</p>
)}
</div>
{selectedDataset && !datasetEligible && (
<p className="text-xs text-status-error-text">
This dataset exceeds the evaluation size limit — pick a smaller one.
</p>
)}

{submitError && (
<div className="rounded-lg px-3 py-2 bg-status-error-bg border border-status-error-border">
Expand Down
Loading