@@ -2,6 +2,10 @@
|
|||||||
|
|
||||||
## [Unreleased]
|
## [Unreleased]
|
||||||
|
|
||||||
|
### Fixed
|
||||||
|
|
||||||
|
- Fixed post-compaction output-token budgeting to ignore stale assistant usage from before the compaction boundary ([#6464](https://github.com/earendil-works/pi/issues/6464)).
|
||||||
|
|
||||||
## [0.80.5] - 2026-07-09
|
## [0.80.5] - 2026-07-09
|
||||||
|
|
||||||
## [0.80.4] - 2026-07-09
|
## [0.80.4] - 2026-07-09
|
||||||
|
|||||||
@@ -3,11 +3,11 @@ import type { AssistantMessage, Context, ImageContent, Message, TextContent, Usa
|
|||||||
export interface ContextUsageEstimate {
|
export interface ContextUsageEstimate {
|
||||||
/** Estimated total context tokens. */
|
/** Estimated total context tokens. */
|
||||||
tokens: number;
|
tokens: number;
|
||||||
/** Tokens reported by the most recent assistant usage block. */
|
/** Tokens reported by the most recent applicable assistant usage block. */
|
||||||
usageTokens: number;
|
usageTokens: number;
|
||||||
/** Estimated tokens after the most recent assistant usage block. */
|
/** Estimated tokens after the most recent applicable assistant usage block. */
|
||||||
trailingTokens: number;
|
trailingTokens: number;
|
||||||
/** Index of the message that provided usage, or null when none exists. */
|
/** Index of the applicable message that provided usage, or null when none exists. */
|
||||||
lastUsageIndex: number | null;
|
lastUsageIndex: number | null;
|
||||||
}
|
}
|
||||||
|
|
||||||
@@ -61,14 +61,29 @@ export function estimateMessageTokens(message: Message): number {
|
|||||||
}
|
}
|
||||||
|
|
||||||
function getLastAssistantUsageInfo(messages: readonly Message[]): { usage: Usage; index: number } | undefined {
|
function getLastAssistantUsageInfo(messages: readonly Message[]): { usage: Usage; index: number } | undefined {
|
||||||
for (let i = messages.length - 1; i >= 0; i--) {
|
let latestPrefixTimestamp = Number.NEGATIVE_INFINITY;
|
||||||
|
let usageInfo: { usage: Usage; index: number } | undefined;
|
||||||
|
|
||||||
|
for (let i = 0; i < messages.length; i++) {
|
||||||
const message = messages[i];
|
const message = messages[i];
|
||||||
if (message.role !== "assistant") continue;
|
if (message.role === "assistant") {
|
||||||
const assistant = message as AssistantMessage;
|
const assistant = message as AssistantMessage;
|
||||||
if (assistant.stopReason === "aborted" || assistant.stopReason === "error") continue;
|
// A newer prefix message was inserted after this response (for example, a
|
||||||
if (calculateContextTokens(assistant.usage) > 0) return { usage: assistant.usage, index: i };
|
// compaction summary), so its usage cannot describe the current prefix.
|
||||||
|
const usageAppliesToPrefix = assistant.timestamp >= latestPrefixTimestamp;
|
||||||
|
if (
|
||||||
|
usageAppliesToPrefix &&
|
||||||
|
assistant.stopReason !== "aborted" &&
|
||||||
|
assistant.stopReason !== "error" &&
|
||||||
|
calculateContextTokens(assistant.usage) > 0
|
||||||
|
) {
|
||||||
|
usageInfo = { usage: assistant.usage, index: i };
|
||||||
|
}
|
||||||
|
}
|
||||||
|
latestPrefixTimestamp = Math.max(latestPrefixTimestamp, message.timestamp);
|
||||||
}
|
}
|
||||||
return undefined;
|
|
||||||
|
return usageInfo;
|
||||||
}
|
}
|
||||||
|
|
||||||
function estimateMessages(messages: readonly Message[]): ContextUsageEstimate {
|
function estimateMessages(messages: readonly Message[]): ContextUsageEstimate {
|
||||||
|
|||||||
@@ -0,0 +1,81 @@
|
|||||||
|
import { describe, expect, it } from "vitest";
|
||||||
|
import { buildBaseOptions } from "../src/api/simple-options.ts";
|
||||||
|
import type { AssistantMessage, Context, Model, Usage } from "../src/types.ts";
|
||||||
|
import { estimateContextTokens } from "../src/utils/estimate.ts";
|
||||||
|
|
||||||
|
function createUsage(totalTokens: number): Usage {
|
||||||
|
return {
|
||||||
|
input: totalTokens,
|
||||||
|
output: 0,
|
||||||
|
cacheRead: 0,
|
||||||
|
cacheWrite: 0,
|
||||||
|
totalTokens,
|
||||||
|
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0, total: 0 },
|
||||||
|
};
|
||||||
|
}
|
||||||
|
|
||||||
|
function createAssistant(timestamp: number, totalTokens: number): AssistantMessage {
|
||||||
|
return {
|
||||||
|
role: "assistant",
|
||||||
|
content: [{ type: "text", text: "kept" }],
|
||||||
|
api: "openai-responses",
|
||||||
|
provider: "openai",
|
||||||
|
model: "test-model",
|
||||||
|
usage: createUsage(totalTokens),
|
||||||
|
stopReason: "stop",
|
||||||
|
timestamp,
|
||||||
|
};
|
||||||
|
}
|
||||||
|
|
||||||
|
const model: Model<"openai-responses"> = {
|
||||||
|
id: "test-model",
|
||||||
|
name: "Test Model",
|
||||||
|
api: "openai-responses",
|
||||||
|
provider: "openai",
|
||||||
|
baseUrl: "https://api.openai.com/v1",
|
||||||
|
reasoning: false,
|
||||||
|
input: ["text"],
|
||||||
|
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
|
||||||
|
contextWindow: 10_000,
|
||||||
|
maxTokens: 8_000,
|
||||||
|
};
|
||||||
|
|
||||||
|
describe("context token estimation", () => {
|
||||||
|
it("ignores stale assistant usage after a newer message is inserted before it", () => {
|
||||||
|
const context: Context = {
|
||||||
|
systemPrompt: "system",
|
||||||
|
messages: [
|
||||||
|
{ role: "user", content: "summary", timestamp: 200 },
|
||||||
|
createAssistant(100, 9_500),
|
||||||
|
{ role: "user", content: "x".repeat(4_000), timestamp: 300 },
|
||||||
|
],
|
||||||
|
};
|
||||||
|
|
||||||
|
expect(estimateContextTokens(context)).toEqual({
|
||||||
|
tokens: 1_005,
|
||||||
|
usageTokens: 0,
|
||||||
|
trailingTokens: 1_005,
|
||||||
|
lastUsageIndex: null,
|
||||||
|
});
|
||||||
|
expect(buildBaseOptions(model, context).maxTokens).toBe(4_899);
|
||||||
|
});
|
||||||
|
|
||||||
|
it("uses assistant usage again after a response to the inserted context", () => {
|
||||||
|
const context: Context = {
|
||||||
|
messages: [
|
||||||
|
{ role: "user", content: "summary", timestamp: 200 },
|
||||||
|
createAssistant(100, 9_500),
|
||||||
|
{ role: "user", content: "new prompt", timestamp: 300 },
|
||||||
|
createAssistant(400, 2_000),
|
||||||
|
{ role: "user", content: "tail", timestamp: 500 },
|
||||||
|
],
|
||||||
|
};
|
||||||
|
|
||||||
|
expect(estimateContextTokens(context)).toEqual({
|
||||||
|
tokens: 2_001,
|
||||||
|
usageTokens: 2_000,
|
||||||
|
trailingTokens: 1,
|
||||||
|
lastUsageIndex: 3,
|
||||||
|
});
|
||||||
|
});
|
||||||
|
});
|
||||||
Reference in New Issue
Block a user