session-runner.test.ts 155 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381382383384385386387388389390391392393394395396397398399400401402403404405406407408409410411412413414415416417418419420421422423424425426427428429430431432433434435436437438439440441442443444445446447448449450451452453454455456457458459460461462463464465466467468469470471472473474475476477478479480481482483484485486487488489490491492493494495496497498499500501502503504505506507508509510511512513514515516517518519520521522523524525526527528529530531532533534535536537538539540541542543544545546547548549550551552553554555556557558559560561562563564565566567568569570571572573574575576577578579580581582583584585586587588589590591592593594595596597598599600601602603604605606607608609610611612613614615616617618619620621622623624625626627628629630631632633634635636637638639640641642643644645646647648649650651652653654655656657658659660661662663664665666667668669670671672673674675676677678679680681682683684685686687688689690691692693694695696697698699700701702703704705706707708709710711712713714715716717718719720721722723724725726727728729730731732733734735736737738739740741742743744745746747748749750751752753754755756757758759760761762763764765766767768769770771772773774775776777778779780781782783784785786787788789790791792793794795796797798799800801802803804805806807808809810811812813814815816817818819820821822823824825826827828829830831832833834835836837838839840841842843844845846847848849850851852853854855856857858859860861862863864865866867868869870871872873874875876877878879880881882883884885886887888889890891892893894895896897898899900901902903904905906907908909910911912913914915916917918919920921922923924925926927928929930931932933934935936937938939940941942943944945946947948949950951952953954955956957958959960961962963964965966967968969970971972973974975976977978979980981982983984985986987988989990991992993994995996997998999100010011002100310041005100610071008100910101011101210131014101510161017101810191020102110221023102410251026102710281029103010311032103310341035103610371038103910401041104210431044104510461047104810491050105110521053105410551056105710581059106010611062106310641065106610671068106910701071107210731074107510761077107810791080108110821083108410851086108710881089109010911092109310941095109610971098109911001101110211031104110511061107110811091110111111121113111411151116111711181119112011211122112311241125112611271128112911301131113211331134113511361137113811391140114111421143114411451146114711481149115011511152115311541155115611571158115911601161116211631164116511661167116811691170117111721173117411751176117711781179118011811182118311841185118611871188118911901191119211931194119511961197119811991200120112021203120412051206120712081209121012111212121312141215121612171218121912201221122212231224122512261227122812291230123112321233123412351236123712381239124012411242124312441245124612471248124912501251125212531254125512561257125812591260126112621263126412651266126712681269127012711272127312741275127612771278127912801281128212831284128512861287128812891290129112921293129412951296129712981299130013011302130313041305130613071308130913101311131213131314131513161317131813191320132113221323132413251326132713281329133013311332133313341335133613371338133913401341134213431344134513461347134813491350135113521353135413551356135713581359136013611362136313641365136613671368136913701371137213731374137513761377137813791380138113821383138413851386138713881389139013911392139313941395139613971398139914001401140214031404140514061407140814091410141114121413141414151416141714181419142014211422142314241425142614271428142914301431143214331434143514361437143814391440144114421443144414451446144714481449145014511452145314541455145614571458145914601461146214631464146514661467146814691470147114721473147414751476147714781479148014811482148314841485148614871488148914901491149214931494149514961497149814991500150115021503150415051506150715081509151015111512151315141515151615171518151915201521152215231524152515261527152815291530153115321533153415351536153715381539154015411542154315441545154615471548154915501551155215531554155515561557155815591560156115621563156415651566156715681569157015711572157315741575157615771578157915801581158215831584158515861587158815891590159115921593159415951596159715981599160016011602160316041605160616071608160916101611161216131614161516161617161816191620162116221623162416251626162716281629163016311632163316341635163616371638163916401641164216431644164516461647164816491650165116521653165416551656165716581659166016611662166316641665166616671668166916701671167216731674167516761677167816791680168116821683168416851686168716881689169016911692169316941695169616971698169917001701170217031704170517061707170817091710171117121713171417151716171717181719172017211722172317241725172617271728172917301731173217331734173517361737173817391740174117421743174417451746174717481749175017511752175317541755175617571758175917601761176217631764176517661767176817691770177117721773177417751776177717781779178017811782178317841785178617871788178917901791179217931794179517961797179817991800180118021803180418051806180718081809181018111812181318141815181618171818181918201821182218231824182518261827182818291830183118321833183418351836183718381839184018411842184318441845184618471848184918501851185218531854185518561857185818591860186118621863186418651866186718681869187018711872187318741875187618771878187918801881188218831884188518861887188818891890189118921893189418951896189718981899190019011902190319041905190619071908190919101911191219131914191519161917191819191920192119221923192419251926192719281929193019311932193319341935193619371938193919401941194219431944194519461947194819491950195119521953195419551956195719581959196019611962196319641965196619671968196919701971197219731974197519761977197819791980198119821983198419851986198719881989199019911992199319941995199619971998199920002001200220032004200520062007200820092010201120122013201420152016201720182019202020212022202320242025202620272028202920302031203220332034203520362037203820392040204120422043204420452046204720482049205020512052205320542055205620572058205920602061206220632064206520662067206820692070207120722073207420752076207720782079208020812082208320842085208620872088208920902091209220932094209520962097209820992100210121022103210421052106210721082109211021112112211321142115211621172118211921202121212221232124212521262127212821292130213121322133213421352136213721382139214021412142214321442145214621472148214921502151215221532154215521562157215821592160216121622163216421652166216721682169217021712172217321742175217621772178217921802181218221832184218521862187218821892190219121922193219421952196219721982199220022012202220322042205220622072208220922102211221222132214221522162217221822192220222122222223222422252226222722282229223022312232223322342235223622372238223922402241224222432244224522462247224822492250225122522253225422552256225722582259226022612262226322642265226622672268226922702271227222732274227522762277227822792280228122822283228422852286228722882289229022912292229322942295229622972298229923002301230223032304230523062307230823092310231123122313231423152316231723182319232023212322232323242325232623272328232923302331233223332334233523362337233823392340234123422343234423452346234723482349235023512352235323542355235623572358235923602361236223632364236523662367236823692370237123722373237423752376237723782379238023812382238323842385238623872388238923902391239223932394239523962397239823992400240124022403240424052406240724082409241024112412241324142415241624172418241924202421242224232424242524262427242824292430243124322433243424352436243724382439244024412442244324442445244624472448244924502451245224532454245524562457245824592460246124622463246424652466246724682469247024712472247324742475247624772478247924802481248224832484248524862487248824892490249124922493249424952496249724982499250025012502250325042505250625072508250925102511251225132514251525162517251825192520252125222523252425252526252725282529253025312532253325342535253625372538253925402541254225432544254525462547254825492550255125522553255425552556255725582559256025612562256325642565256625672568256925702571257225732574257525762577257825792580258125822583258425852586258725882589259025912592259325942595259625972598259926002601260226032604260526062607260826092610261126122613261426152616261726182619262026212622262326242625262626272628262926302631263226332634263526362637263826392640264126422643264426452646264726482649265026512652265326542655265626572658265926602661266226632664266526662667266826692670267126722673267426752676267726782679268026812682268326842685268626872688268926902691269226932694269526962697269826992700270127022703270427052706270727082709271027112712271327142715271627172718271927202721272227232724272527262727272827292730273127322733273427352736273727382739274027412742274327442745274627472748274927502751275227532754275527562757275827592760276127622763276427652766276727682769277027712772277327742775277627772778277927802781278227832784278527862787278827892790279127922793279427952796279727982799280028012802280328042805280628072808280928102811281228132814281528162817281828192820282128222823282428252826282728282829283028312832283328342835283628372838283928402841284228432844284528462847284828492850285128522853285428552856285728582859286028612862286328642865286628672868286928702871287228732874287528762877287828792880288128822883288428852886288728882889289028912892289328942895289628972898289929002901290229032904290529062907290829092910291129122913291429152916291729182919292029212922292329242925292629272928292929302931293229332934293529362937293829392940294129422943294429452946294729482949295029512952295329542955295629572958295929602961296229632964296529662967296829692970297129722973297429752976297729782979298029812982298329842985298629872988298929902991299229932994299529962997299829993000300130023003300430053006300730083009301030113012301330143015301630173018301930203021302230233024302530263027302830293030303130323033303430353036303730383039304030413042304330443045304630473048304930503051305230533054305530563057305830593060306130623063306430653066306730683069307030713072307330743075307630773078307930803081308230833084308530863087308830893090309130923093309430953096309730983099310031013102310331043105310631073108310931103111311231133114311531163117311831193120312131223123312431253126312731283129313031313132313331343135313631373138313931403141314231433144314531463147314831493150315131523153315431553156315731583159316031613162316331643165316631673168316931703171317231733174317531763177317831793180318131823183318431853186318731883189319031913192319331943195319631973198319932003201320232033204320532063207320832093210321132123213321432153216321732183219322032213222322332243225322632273228322932303231323232333234323532363237323832393240324132423243324432453246324732483249325032513252325332543255325632573258325932603261326232633264326532663267326832693270327132723273327432753276327732783279328032813282328332843285328632873288328932903291329232933294329532963297329832993300330133023303330433053306330733083309331033113312331333143315331633173318331933203321332233233324332533263327332833293330333133323333333433353336333733383339334033413342334333443345334633473348334933503351335233533354335533563357335833593360336133623363336433653366336733683369337033713372337333743375337633773378337933803381338233833384338533863387338833893390339133923393339433953396339733983399340034013402340334043405340634073408340934103411341234133414341534163417341834193420342134223423342434253426342734283429343034313432343334343435343634373438343934403441344234433444344534463447344834493450345134523453345434553456345734583459346034613462346334643465346634673468346934703471347234733474347534763477347834793480348134823483348434853486348734883489349034913492349334943495349634973498349935003501350235033504350535063507350835093510351135123513351435153516351735183519352035213522352335243525352635273528352935303531353235333534353535363537353835393540354135423543354435453546354735483549355035513552355335543555355635573558355935603561356235633564356535663567356835693570357135723573357435753576357735783579358035813582358335843585358635873588358935903591359235933594359535963597359835993600360136023603360436053606360736083609361036113612361336143615361636173618361936203621362236233624362536263627362836293630363136323633363436353636363736383639364036413642364336443645364636473648364936503651365236533654365536563657365836593660366136623663366436653666366736683669367036713672367336743675367636773678367936803681368236833684368536863687368836893690369136923693369436953696369736983699370037013702370337043705370637073708370937103711371237133714371537163717371837193720372137223723372437253726372737283729373037313732373337343735373637373738373937403741374237433744374537463747374837493750375137523753375437553756375737583759376037613762376337643765376637673768376937703771377237733774377537763777377837793780378137823783378437853786378737883789379037913792379337943795379637973798379938003801380238033804380538063807380838093810381138123813381438153816381738183819382038213822382338243825382638273828382938303831383238333834383538363837383838393840384138423843384438453846384738483849385038513852385338543855385638573858385938603861386238633864386538663867386838693870387138723873387438753876387738783879388038813882388338843885388638873888388938903891389238933894389538963897389838993900390139023903390439053906390739083909391039113912391339143915391639173918391939203921392239233924392539263927392839293930393139323933393439353936393739383939394039413942394339443945394639473948394939503951395239533954395539563957395839593960396139623963396439653966396739683969397039713972397339743975397639773978397939803981398239833984398539863987398839893990399139923993399439953996399739983999400040014002400340044005400640074008400940104011401240134014401540164017401840194020402140224023402440254026402740284029403040314032403340344035403640374038403940404041404240434044404540464047404840494050405140524053405440554056405740584059406040614062406340644065406640674068406940704071407240734074407540764077407840794080408140824083408440854086408740884089409040914092409340944095409640974098409941004101410241034104410541064107410841094110411141124113411441154116411741184119412041214122412341244125412641274128412941304131413241334134413541364137413841394140414141424143414441454146414741484149415041514152415341544155415641574158415941604161416241634164416541664167416841694170417141724173417441754176417741784179418041814182418341844185418641874188418941904191419241934194419541964197419841994200420142024203420442054206420742084209421042114212421342144215
  1. import { describe, expect, test } from "bun:test"
  2. import {
  3. LLMClient,
  4. LLMError,
  5. LLMEvent,
  6. Model,
  7. ToolFailure,
  8. TransportReason,
  9. InvalidRequestReason,
  10. RateLimitReason,
  11. type LLMClientShape,
  12. type LLMRequest,
  13. } from "@opencode-ai/llm"
  14. import * as OpenAIChat from "@opencode-ai/llm/protocols/openai-chat"
  15. import { Database } from "@opencode-ai/core/database/database"
  16. import { makeLocationNode } from "@opencode-ai/core/effect/app-node"
  17. import { AppNodeBuilder } from "@opencode-ai/core/effect/app-node-builder"
  18. import { LayerNodePlatform } from "@opencode-ai/core/effect/app-node-platform"
  19. import { LayerNode } from "@opencode-ai/core/effect/layer-node"
  20. import { EventV2 } from "@opencode-ai/core/event"
  21. import { PermissionV2 } from "@opencode-ai/core/permission"
  22. import { EventTable } from "@opencode-ai/core/event/sql"
  23. import { Project } from "@opencode-ai/core/project"
  24. import { ProjectTable } from "@opencode-ai/core/project/sql"
  25. import { Form } from "@opencode-ai/core/form"
  26. import { AbsolutePath } from "@opencode-ai/core/schema"
  27. import { SessionV2 } from "@opencode-ai/core/session"
  28. import { Snapshot } from "@opencode-ai/core/snapshot"
  29. import { SessionEvent } from "@opencode-ai/core/session/event"
  30. import { SessionPending } from "@opencode-ai/core/session/pending"
  31. import { SessionMessage } from "@opencode-ai/core/session/message"
  32. import { Money } from "@opencode-ai/schema/money"
  33. import { SessionProjector } from "@opencode-ai/core/session/projector"
  34. import { SessionExecution } from "@opencode-ai/core/session/execution"
  35. import { SessionRunCoordinator } from "@opencode-ai/core/session/run-coordinator"
  36. import { SessionRunner } from "@opencode-ai/core/session/runner"
  37. import * as SessionRunnerLLM from "@opencode-ai/core/session/runner/llm"
  38. import { SessionRunnerModel } from "@opencode-ai/core/session/runner/model"
  39. import { SessionRunnerSystemPrompt } from "@opencode-ai/core/session/runner/system-prompt"
  40. import { ToolRegistry } from "@opencode-ai/core/tool/registry"
  41. import { PluginSupervisor } from "@opencode-ai/core/plugin/supervisor"
  42. import { QuestionTool } from "@opencode-ai/core/tool/question"
  43. import { ToolOutputStore } from "@opencode-ai/core/tool-output-store"
  44. import { AgentV2 } from "@opencode-ai/core/agent"
  45. import { Config } from "@opencode-ai/core/config"
  46. import { ConfigCompaction } from "@opencode-ai/core/config/compaction"
  47. import { Tool } from "@opencode-ai/core/tool/tool"
  48. import {
  49. InstructionStateTable,
  50. SessionPendingTable,
  51. SessionMessageTable,
  52. SessionTable,
  53. } from "@opencode-ai/core/session/sql"
  54. import { InstructionEntry } from "@opencode-ai/core/session/instruction-entry"
  55. import { SessionStore } from "@opencode-ai/core/session/store"
  56. import { Instructions } from "@opencode-ai/core/instructions"
  57. import { InstructionBuiltIns } from "@opencode-ai/core/instructions/builtins"
  58. import { InstructionDiscovery } from "@opencode-ai/core/instruction-discovery"
  59. import { SkillGuidance } from "@opencode-ai/core/skill/guidance"
  60. import { ReferenceGuidance } from "@opencode-ai/core/reference/guidance"
  61. import { McpGuidance } from "@opencode-ai/core/mcp/guidance"
  62. import { ModelV2 } from "@opencode-ai/core/model"
  63. import { Location } from "@opencode-ai/core/location"
  64. import { ProviderV2 } from "@opencode-ai/core/provider"
  65. import { Cause, DateTime, Deferred, Effect, Exit, Fiber, Layer, Schema, Scope, Stream } from "effect"
  66. import { TestClock } from "effect/testing"
  67. import { asc, eq } from "drizzle-orm"
  68. import { testEffect } from "./lib/effect"
  69. const requests: LLMRequest[] = []
  70. let response: LLMEvent[] = []
  71. let responses: LLMEvent[][] | undefined
  72. let responseStream: Stream.Stream<LLMEvent, LLMError> | undefined
  73. let responseStreams: Stream.Stream<LLMEvent, LLMError>[] | undefined
  74. let streamGate: Deferred.Deferred<void> | undefined
  75. let streamStarted: Deferred.Deferred<void> | undefined
  76. let streamFailure: LLMError | undefined
  77. let toolExecutionGate: Deferred.Deferred<void> | undefined
  78. let toolExecutionsStarted: Deferred.Deferred<void> | undefined
  79. let toolExecutionsReady = 5
  80. let activeToolExecutions = 0
  81. let maxActiveToolExecutions = 0
  82. const client = Layer.succeed(
  83. LLMClient.Service,
  84. LLMClient.Service.of({
  85. prepare: () => Effect.die("unused"),
  86. stream: ((request: LLMRequest) => {
  87. requests.push(request)
  88. if (responseStreams) return responseStreams.shift() ?? Stream.empty
  89. if (responseStream) {
  90. const stream = responseStream
  91. responseStream = undefined
  92. return stream
  93. }
  94. const events = streamFailure
  95. ? Stream.fail(streamFailure)
  96. : Stream.fromIterable(responses === undefined ? response : (responses.shift() ?? []))
  97. if (!streamGate) return events
  98. return Stream.unwrap(
  99. (streamStarted ? Deferred.succeed(streamStarted, undefined) : Effect.void).pipe(
  100. Effect.andThen(Deferred.await(streamGate)),
  101. Effect.as(events),
  102. ),
  103. )
  104. }) as unknown as LLMClientShape["stream"],
  105. generate: () => Effect.die("unused"),
  106. }),
  107. )
  108. const reply = {
  109. stop: () => [
  110. LLMEvent.stepStart({ index: 0 }),
  111. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  112. LLMEvent.finish({ reason: "stop" }),
  113. ],
  114. text: (text: string, id: string) => fragmentFixture("text", id, [text]).completeEvents,
  115. textWithUsage: (text: string, id: string, inputTokens: number) =>
  116. fragmentFixture("text", id, [text]).completeEvents.map((event) =>
  117. LLMEvent.is.stepFinish(event)
  118. ? LLMEvent.stepFinish({
  119. index: event.index,
  120. reason: event.reason,
  121. usage: { inputTokens, nonCachedInputTokens: inputTokens },
  122. })
  123. : event,
  124. ),
  125. tool: (id: string, name: string, input: unknown) => [
  126. LLMEvent.stepStart({ index: 0 }),
  127. LLMEvent.toolCall({ id, name, input }),
  128. LLMEvent.stepFinish({ index: 0, reason: "tool-calls" }),
  129. LLMEvent.finish({ reason: "tool-calls" }),
  130. ],
  131. }
  132. const model = Model.make({ id: "fake-model", provider: "fake", route: OpenAIChat.route })
  133. const defaultSystem = SessionRunnerSystemPrompt.provider(model)
  134. const replacementModel = Model.make({ id: "replacement", provider: "fake", route: OpenAIChat.route })
  135. const compactModel = Model.make({
  136. id: "compact",
  137. provider: "fake",
  138. route: OpenAIChat.route.with({ limits: { context: 4_000, output: 50 } }),
  139. })
  140. const undersizedContextModel = Model.make({
  141. id: "undersized-context",
  142. provider: "fake",
  143. route: OpenAIChat.route.with({ limits: { context: 1, output: 1_000 } }),
  144. })
  145. const recoveryModel = Model.make({
  146. id: "recovery",
  147. provider: "fake",
  148. route: OpenAIChat.route.with({ limits: { context: 20_000, output: 1_000 } }),
  149. })
  150. test("calculates step cost using the matching context tier", () => {
  151. expect(
  152. SessionRunnerLLM.calculateCost(
  153. [
  154. {
  155. input: Money.USDPerMillionTokens.make(1),
  156. output: Money.USDPerMillionTokens.make(2),
  157. cache: {
  158. read: Money.USDPerMillionTokens.make(0.1),
  159. write: Money.USDPerMillionTokens.make(0.5),
  160. },
  161. },
  162. {
  163. tier: { type: "context", size: 100 },
  164. input: Money.USDPerMillionTokens.make(3),
  165. output: Money.USDPerMillionTokens.make(4),
  166. cache: {
  167. read: Money.USDPerMillionTokens.make(0.2),
  168. write: Money.USDPerMillionTokens.make(0.6),
  169. },
  170. },
  171. ],
  172. { input: 80, output: 10, reasoning: 2, cache: { read: 20, write: 1 } },
  173. ),
  174. ).toBeCloseTo(0.0002926)
  175. })
  176. test("does not apply an ineligible tier without base pricing", () => {
  177. expect(
  178. SessionRunnerLLM.calculateCost(
  179. [
  180. {
  181. tier: { type: "context", size: 100 },
  182. input: Money.USDPerMillionTokens.make(3),
  183. output: Money.USDPerMillionTokens.make(4),
  184. cache: {
  185. read: Money.USDPerMillionTokens.make(0.2),
  186. write: Money.USDPerMillionTokens.make(0.6),
  187. },
  188. },
  189. ],
  190. { input: 80, output: 10, reasoning: 2, cache: { read: 20, write: 0 } },
  191. ),
  192. ).toBe(Money.USD.zero)
  193. })
  194. const authorizations: Tool.Context[] = []
  195. const executions: string[] = []
  196. const permissionFail = Tool.make({
  197. description: "Reject a permission",
  198. input: Schema.Struct({}),
  199. output: Schema.Struct({}),
  200. execute: () =>
  201. new ToolFailure({
  202. message: "Permission denied: edit",
  203. error: new PermissionV2.BlockedError({
  204. rules: [],
  205. permission: "edit",
  206. resources: ["src/index.ts"],
  207. }),
  208. }),
  209. })
  210. const permission = Layer.succeed(
  211. PermissionV2.Service,
  212. PermissionV2.Service.of({
  213. assert: () => Effect.die("unused"),
  214. ask: () => Effect.die("unused"),
  215. reply: () => Effect.die("unused"),
  216. get: () => Effect.die("unused"),
  217. forSession: () => Effect.die("unused"),
  218. list: () => Effect.die("unused"),
  219. }),
  220. )
  221. const echo = Layer.effectDiscard(
  222. ToolRegistry.Service.use((registry) =>
  223. registry.register({
  224. echo: Tool.make({
  225. description: "Echo text",
  226. input: Schema.Struct({ text: Schema.String }),
  227. output: Schema.Struct({ text: Schema.String }),
  228. toModelOutput: ({ output }) => [{ type: "text", text: output.text }],
  229. execute: ({ text }, context) =>
  230. Effect.gen(function* () {
  231. authorizations.push(context)
  232. executions.push(text)
  233. activeToolExecutions++
  234. maxActiveToolExecutions = Math.max(maxActiveToolExecutions, activeToolExecutions)
  235. if (activeToolExecutions === toolExecutionsReady && toolExecutionsStarted) {
  236. yield* Deferred.succeed(toolExecutionsStarted, undefined)
  237. }
  238. if (toolExecutionGate) yield* Deferred.await(toolExecutionGate)
  239. return { text }
  240. }).pipe(Effect.ensuring(Effect.sync(() => activeToolExecutions--))),
  241. }),
  242. defect: Tool.make({
  243. description: "Fail unexpectedly",
  244. input: Schema.Struct({}),
  245. output: Schema.Struct({}),
  246. execute: () =>
  247. (toolExecutionGate ? Deferred.await(toolExecutionGate) : Effect.void).pipe(
  248. Effect.andThen(Effect.die("unexpected tool defect")),
  249. ),
  250. }),
  251. // BigInt output with no model content forces ToolOutputStore.bound onto its
  252. // JSON.stringify encode path, which fails with a typed StorageError.
  253. storefail: Tool.make({
  254. description: "Produce output that cannot be persisted",
  255. input: Schema.Struct({}),
  256. output: Schema.Any,
  257. execute: () => Effect.succeed({ big: 1n }),
  258. }),
  259. }),
  260. ),
  261. )
  262. const echoNode = makeLocationNode({ name: "test/session-runner-tools", layer: echo, deps: [ToolRegistry.node] })
  263. let modelResolveHook = Effect.void
  264. let currentModel = model
  265. const models = SessionRunnerModel.layerWith((session) =>
  266. modelResolveHook.pipe(
  267. Effect.as(
  268. SessionRunnerModel.resolved(
  269. session.model?.id === "replacement" ? replacementModel : currentModel,
  270. session.model?.variant,
  271. ),
  272. ),
  273. ),
  274. )
  275. const systemContextKey = Instructions.Key.make("test/context")
  276. let systemBaseline = "Initial context"
  277. let systemRemoved = false
  278. let systemUnavailable = false
  279. let systemLoadHook = Effect.void
  280. const skillBaselines = new Map<AgentV2.ID, string>()
  281. const systemContext = Layer.mock(InstructionBuiltIns.Service, {
  282. load: () =>
  283. Effect.sync(() =>
  284. Instructions.make({
  285. key: systemContextKey,
  286. codec: Schema.toCodecJson(Schema.String),
  287. read: systemLoadHook.pipe(
  288. Effect.andThen(
  289. Effect.sync(() =>
  290. systemUnavailable ? Instructions.unavailable : systemRemoved ? Instructions.removed : systemBaseline,
  291. ),
  292. ),
  293. ),
  294. render: {
  295. initial: String,
  296. changed: (_previous, current) => current,
  297. removed: () => "System context source removed: test/context",
  298. },
  299. }),
  300. ),
  301. })
  302. const instructionContext = Layer.mock(InstructionDiscovery.Service, { load: () => Effect.succeed(Instructions.empty) })
  303. const skillGuidance = Layer.mock(SkillGuidance.Service, {
  304. load: (agent) =>
  305. Effect.succeed(
  306. skillBaselines.has(agent.id)
  307. ? Instructions.make({
  308. key: Instructions.Key.make("test/skill-guidance"),
  309. codec: Schema.toCodecJson(Schema.String),
  310. read: Effect.succeed(skillBaselines.get(agent.id)!),
  311. render: {
  312. initial: String,
  313. changed: (_previous, current) => current,
  314. removed: () => "Skill guidance removed",
  315. },
  316. })
  317. : Instructions.empty,
  318. ),
  319. })
  320. const referenceGuidance = Layer.mock(ReferenceGuidance.Service, { load: () => Effect.succeed(Instructions.empty) })
  321. const mcpGuidance = Layer.mock(McpGuidance.Service, { load: () => Effect.succeed(Instructions.empty) })
  322. const config = Layer.succeed(
  323. Config.Service,
  324. Config.Service.of({
  325. entries: () =>
  326. Effect.succeed([
  327. new Config.Document({
  328. type: "document",
  329. info: new Config.Info({
  330. compaction: new ConfigCompaction.Info({
  331. buffer: 3_000,
  332. keep: new ConfigCompaction.Keep({ tokens: 1_000 }),
  333. }),
  334. }),
  335. }),
  336. ]),
  337. }),
  338. )
  339. let pluginFlushHook = Effect.void
  340. const pluginSupervisor = Layer.succeed(
  341. PluginSupervisor.Service,
  342. PluginSupervisor.Service.of({
  343. flush: Effect.suspend(() => pluginFlushHook),
  344. }),
  345. )
  346. const runnerLayer = AppNodeBuilder.build(SessionRunnerLLM.node, [
  347. [Snapshot.node, Snapshot.noopLayer],
  348. [LayerNodePlatform.llmClient, client],
  349. [SessionRunnerModel.node, models],
  350. [InstructionBuiltIns.node, systemContext],
  351. [InstructionDiscovery.node, instructionContext],
  352. [Location.node, Location.boundNode({ directory: AbsolutePath.make("/project") })],
  353. [SkillGuidance.node, skillGuidance],
  354. [ReferenceGuidance.node, referenceGuidance],
  355. [PermissionV2.node, permission],
  356. [Config.node, config],
  357. [McpGuidance.node, mcpGuidance],
  358. [ToolOutputStore.node, ToolOutputStore.nodeWithoutConfig],
  359. [PluginSupervisor.node, pluginSupervisor],
  360. ])
  361. const execution = Layer.effect(
  362. SessionExecution.Service,
  363. Effect.gen(function* () {
  364. const sessionRunner = yield* SessionRunner.Service
  365. const coordinator = yield* SessionRunCoordinator.make<SessionV2.ID, SessionRunner.RunError>({
  366. drain: (sessionID, force) => sessionRunner.drain({ sessionID, force }),
  367. })
  368. return SessionExecution.Service.of({
  369. active: coordinator.active,
  370. resume: coordinator.run,
  371. wake: coordinator.wake,
  372. interrupt: coordinator.interrupt,
  373. awaitIdle: coordinator.awaitIdle,
  374. })
  375. }),
  376. ).pipe(Layer.provide(runnerLayer))
  377. const it = testEffect(
  378. AppNodeBuilder.build(
  379. LayerNode.group([
  380. Database.node,
  381. EventV2.node,
  382. Form.node,
  383. SessionProjector.node,
  384. SessionStore.node,
  385. AgentV2.node,
  386. ToolRegistry.node,
  387. ToolRegistry.toolsNode,
  388. echoNode,
  389. SessionRunnerModel.node,
  390. InstructionBuiltIns.node,
  391. InstructionDiscovery.node,
  392. InstructionEntry.node,
  393. SkillGuidance.node,
  394. ReferenceGuidance.node,
  395. Config.node,
  396. Snapshot.node,
  397. SessionRunnerLLM.node,
  398. SessionExecution.node,
  399. SessionV2.node,
  400. ]),
  401. [
  402. [LayerNodePlatform.llmClient, client],
  403. [PermissionV2.node, permission],
  404. [SessionRunnerModel.node, models],
  405. [InstructionBuiltIns.node, systemContext],
  406. [InstructionDiscovery.node, instructionContext],
  407. [Location.node, Location.boundNode({ directory: AbsolutePath.make("/project") })],
  408. [SkillGuidance.node, skillGuidance],
  409. [ReferenceGuidance.node, referenceGuidance],
  410. [Snapshot.node, Snapshot.noopLayer],
  411. [SessionExecution.node, execution],
  412. [Config.node, config],
  413. [ToolOutputStore.node, ToolOutputStore.nodeWithoutConfig],
  414. [PluginSupervisor.node, pluginSupervisor],
  415. ],
  416. ),
  417. )
  418. const sessionID = SessionV2.ID.make("ses_runner_test")
  419. const otherSessionID = SessionV2.ID.make("ses_runner_other")
  420. const admit = (session: SessionV2.Interface, text: string) => session.prompt({ sessionID, text, resume: false })
  421. const insertSession = (id: SessionV2.ID) =>
  422. Effect.gen(function* () {
  423. const { db } = yield* Database.Service
  424. yield* db
  425. .insert(SessionTable)
  426. .values({
  427. id,
  428. project_id: Project.ID.global,
  429. slug: id,
  430. directory: "/project",
  431. title: "test",
  432. version: "test",
  433. })
  434. .onConflictDoNothing()
  435. .run()
  436. .pipe(Effect.orDie)
  437. })
  438. const setup = Effect.gen(function* () {
  439. const { db } = yield* Database.Service
  440. requests.length = 0
  441. authorizations.length = 0
  442. executions.length = 0
  443. response = []
  444. systemBaseline = "Initial context"
  445. systemRemoved = false
  446. systemUnavailable = false
  447. systemLoadHook = Effect.void
  448. modelResolveHook = Effect.void
  449. pluginFlushHook = Effect.void
  450. currentModel = model
  451. skillBaselines.clear()
  452. responses = undefined
  453. streamFailure = undefined
  454. responseStream = undefined
  455. responseStreams = undefined
  456. streamGate = undefined
  457. streamStarted = undefined
  458. toolExecutionGate = undefined
  459. toolExecutionsStarted = undefined
  460. toolExecutionsReady = 5
  461. activeToolExecutions = 0
  462. maxActiveToolExecutions = 0
  463. const agents = yield* AgentV2.Service
  464. yield* agents.transform((draft) =>
  465. draft.update(AgentV2.ID.make("build"), (agent) => {
  466. agent.mode = "primary"
  467. }),
  468. )
  469. yield* db
  470. .insert(ProjectTable)
  471. .values({ id: Project.ID.global, worktree: AbsolutePath.make("/project"), sandboxes: [] })
  472. .onConflictDoNothing()
  473. .run()
  474. .pipe(Effect.orDie)
  475. yield* insertSession(sessionID)
  476. return yield* SessionV2.Service
  477. })
  478. const providerUnavailable = () =>
  479. new LLMError({
  480. module: "test",
  481. method: "stream",
  482. reason: new TransportReason({ message: "Provider unavailable" }),
  483. })
  484. const invalidRequest = () =>
  485. new LLMError({
  486. module: "test",
  487. method: "stream",
  488. reason: new InvalidRequestReason({ message: "Invalid request" }),
  489. })
  490. const rateLimited = (retryAfterMs?: number) =>
  491. new LLMError({
  492. module: "test",
  493. method: "stream",
  494. reason: new RateLimitReason({ message: "Rate limited", retryAfterMs }),
  495. })
  496. const setupOverflowRecovery = Effect.gen(function* () {
  497. const session = yield* setup
  498. response = reply.text("Earlier answer", "text-earlier")
  499. yield* admit(session, "Earlier question ".repeat(700))
  500. yield* session.resume(sessionID)
  501. currentModel = recoveryModel
  502. requests.length = 0
  503. return session
  504. })
  505. const messageTexts = (request: LLMRequest, role: "user" | "system") =>
  506. request.messages.flatMap((message) =>
  507. message.role === role ? message.content.flatMap((content) => (content.type === "text" ? [content.text] : [])) : [],
  508. )
  509. const userTexts = (request: LLMRequest) => messageTexts(request, "user")
  510. const systemTexts = (request: LLMRequest) => messageTexts(request, "system")
  511. const recordedEventTypes = (id: SessionV2.ID) =>
  512. Effect.gen(function* () {
  513. const { db } = yield* Database.Service
  514. return yield* db
  515. .select({ type: EventTable.type })
  516. .from(EventTable)
  517. .where(eq(EventTable.aggregate_id, id))
  518. .orderBy(asc(EventTable.seq))
  519. .all()
  520. .pipe(
  521. Effect.orDie,
  522. Effect.map((rows) => rows.map((row) => row.type)),
  523. )
  524. })
  525. const recordedStepSettlementEvents = (id: SessionV2.ID, assistantMessageID: SessionMessage.ID) =>
  526. Effect.gen(function* () {
  527. const { db } = yield* Database.Service
  528. const settlementTypes = new Set([
  529. "session.step.started.1",
  530. "session.tool.called.1",
  531. "session.tool.success.1",
  532. "session.tool.failed.1",
  533. "session.step.ended.1",
  534. "session.step.failed.1",
  535. ])
  536. return (yield* db
  537. .select({ type: EventTable.type, data: EventTable.data })
  538. .from(EventTable)
  539. .where(eq(EventTable.aggregate_id, id))
  540. .orderBy(asc(EventTable.seq))
  541. .all()
  542. .pipe(Effect.orDie)).filter(
  543. (event) => settlementTypes.has(event.type) && event.data.assistantMessageID === assistantMessageID,
  544. )
  545. })
  546. const hostedCall = (id: string, query: string) =>
  547. LLMEvent.toolCall({ id, name: "web_search", input: { query }, providerExecuted: true })
  548. const requireAssistant = (messages: readonly SessionMessage.Info[]) => {
  549. const assistant = messages.find((message) => message.type === "assistant")
  550. if (!assistant) throw new Error("Assistant message missing")
  551. return assistant
  552. }
  553. const replaySessionProjection = (id: SessionV2.ID) =>
  554. Effect.gen(function* () {
  555. const { db } = yield* Database.Service
  556. const events = yield* EventV2.Service
  557. const recorded = yield* db
  558. .select()
  559. .from(EventTable)
  560. .where(eq(EventTable.aggregate_id, id))
  561. .orderBy(asc(EventTable.seq))
  562. .all()
  563. .pipe(Effect.orDie)
  564. yield* events.remove(id)
  565. yield* db.delete(InstructionStateTable).where(eq(InstructionStateTable.session_id, id)).run().pipe(Effect.orDie)
  566. yield* db.delete(SessionPendingTable).where(eq(SessionPendingTable.session_id, id)).run().pipe(Effect.orDie)
  567. yield* db.delete(SessionMessageTable).where(eq(SessionMessageTable.session_id, id)).run().pipe(Effect.orDie)
  568. yield* events.replayAll(
  569. recorded.map((event) => ({
  570. id: event.id,
  571. created: DateTime.makeUnsafe(event.created),
  572. aggregateID: event.aggregate_id,
  573. seq: event.seq,
  574. type: event.type,
  575. data: event.data,
  576. })),
  577. )
  578. })
  579. type FragmentKind = "text" | "reasoning" | "tool input"
  580. type FragmentFixture = {
  581. readonly delta: EventV2.Definition
  582. readonly completeEvents: LLMEvent[]
  583. readonly partialEvents: LLMEvent[]
  584. readonly expectedAssistant: unknown
  585. readonly expectedContent: unknown
  586. }
  587. const fragmentKinds: readonly FragmentKind[] = ["text", "reasoning", "tool input"]
  588. const fragmentID = (kind: FragmentKind, suffix: string) => `${kind === "tool input" ? "call" : kind}-${suffix}`
  589. const fragmentFixture = (kind: FragmentKind, id: string, chunks: readonly string[]): FragmentFixture => {
  590. const text = chunks.join("")
  591. switch (kind) {
  592. case "text": {
  593. const partialEvents = [
  594. LLMEvent.stepStart({ index: 0 }),
  595. LLMEvent.textStart({ id }),
  596. ...chunks.map((text) => LLMEvent.textDelta({ id, text })),
  597. ]
  598. const expectedContent = { type: "text", text }
  599. return {
  600. delta: SessionEvent.Text.Delta,
  601. partialEvents,
  602. completeEvents: [
  603. ...partialEvents,
  604. LLMEvent.textEnd({ id }),
  605. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  606. LLMEvent.finish({ reason: "stop" }),
  607. ],
  608. expectedAssistant: { type: "assistant", finish: "stop", content: [expectedContent] },
  609. expectedContent,
  610. }
  611. }
  612. case "reasoning": {
  613. const partialEvents = [
  614. LLMEvent.stepStart({ index: 0 }),
  615. LLMEvent.reasoningStart({ id }),
  616. ...chunks.map((text) => LLMEvent.reasoningDelta({ id, text })),
  617. ]
  618. const expectedContent = { type: "reasoning", text }
  619. return {
  620. delta: SessionEvent.Reasoning.Delta,
  621. partialEvents,
  622. completeEvents: [
  623. ...partialEvents,
  624. LLMEvent.reasoningEnd({ id }),
  625. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  626. LLMEvent.finish({ reason: "stop" }),
  627. ],
  628. expectedAssistant: { type: "assistant", finish: "stop", content: [expectedContent] },
  629. expectedContent,
  630. }
  631. }
  632. case "tool input": {
  633. const partialEvents = [
  634. LLMEvent.stepStart({ index: 0 }),
  635. LLMEvent.toolInputStart({ id, name: "echo" }),
  636. ...chunks.map((text) => LLMEvent.toolInputDelta({ id, name: "echo", text })),
  637. ]
  638. const expectedContent = { type: "tool", id, state: { status: "streaming", input: text } }
  639. return {
  640. delta: SessionEvent.Tool.Input.Delta,
  641. partialEvents,
  642. completeEvents: [...partialEvents, LLMEvent.toolInputEnd({ id, name: "echo" })],
  643. expectedAssistant: { type: "assistant", content: [expectedContent] },
  644. expectedContent,
  645. }
  646. }
  647. }
  648. }
  649. const verifyEphemeralDeltas = (kind: FragmentKind) =>
  650. Effect.gen(function* () {
  651. const session = yield* setup
  652. const prompt = `Stream ${kind}`
  653. const chunks = Array.from({ length: 32 }, (_, index) => `${index},`)
  654. const fixture = fragmentFixture(kind, fragmentID(kind, "many"), chunks)
  655. const expectedContext = [{ type: "user", text: prompt }, fixture.expectedAssistant]
  656. yield* admit(session, prompt)
  657. const events = yield* EventV2.Service
  658. const live = yield* events.subscribe(fixture.delta).pipe(Stream.take(32), Stream.runCollect, Effect.forkScoped)
  659. yield* Effect.yieldNow
  660. response = fixture.completeEvents
  661. yield* session.resume(sessionID)
  662. const { db } = yield* Database.Service
  663. const deltas = yield* db
  664. .select({ type: EventTable.type })
  665. .from(EventTable)
  666. .where(eq(EventTable.type, EventV2.versionedType(fixture.delta.type, 1)))
  667. .all()
  668. .pipe(Effect.orDie)
  669. expect(Array.from(yield* Fiber.join(live))).toHaveLength(32)
  670. expect(deltas).toHaveLength(0)
  671. expect(yield* session.context(sessionID)).toMatchObject(expectedContext)
  672. yield* replaySessionProjection(sessionID)
  673. expect(yield* session.context(sessionID)).toMatchObject(expectedContext)
  674. })
  675. const verifyPartialFlushOnFailure = (kind: FragmentKind) =>
  676. Effect.gen(function* () {
  677. const session = yield* setup
  678. const prompt = `Fail after ${kind}`
  679. const fixture = fragmentFixture(kind, fragmentID(kind, "partial"), ["Partial"])
  680. const failure = providerUnavailable()
  681. yield* admit(session, prompt)
  682. responseStream = Stream.concat(Stream.fromIterable(fixture.partialEvents), Stream.fail(failure))
  683. expect(yield* session.resume(sessionID).pipe(Effect.flip)).toBe(failure)
  684. expect(yield* session.context(sessionID)).toMatchObject([
  685. { type: "user", text: prompt },
  686. {
  687. type: "assistant",
  688. finish: "error",
  689. error: { type: "provider.transport", message: "Provider unavailable" },
  690. content: [fixture.expectedContent],
  691. },
  692. ])
  693. expect(requests).toHaveLength(1)
  694. })
  695. const verifyPartialFlushOnInterruption = (kind: FragmentKind) =>
  696. Effect.gen(function* () {
  697. const session = yield* setup
  698. const prompt = `Interrupt after ${kind}`
  699. const fixture = fragmentFixture(kind, fragmentID(kind, "interrupted"), ["Partial"])
  700. const streamed = yield* Deferred.make<void>()
  701. yield* admit(session, prompt)
  702. responseStream = Stream.concat(
  703. Stream.fromIterable(fixture.partialEvents),
  704. Stream.fromEffect(Deferred.succeed(streamed, undefined)).pipe(Stream.flatMap(() => Stream.never)),
  705. )
  706. const runner = yield* SessionRunner.Service
  707. const fiber = yield* runner.drain({ sessionID, force: true }).pipe(Effect.forkChild)
  708. yield* Deferred.await(streamed)
  709. yield* Fiber.interrupt(fiber)
  710. expect(yield* session.context(sessionID)).toMatchObject([
  711. { type: "user", text: prompt },
  712. {
  713. type: "assistant",
  714. finish: "error",
  715. error: { type: "aborted", message: "Step interrupted" },
  716. content: [
  717. kind === "tool input"
  718. ? { type: "tool", id: fragmentID(kind, "interrupted"), state: { status: "error" } }
  719. : fixture.expectedContent,
  720. ],
  721. },
  722. ])
  723. })
  724. describe("SessionRunnerLLM", () => {
  725. it.effect("advertises and executes a location registered tool", () =>
  726. Effect.gen(function* () {
  727. const session = yield* setup
  728. const registry = yield* ToolRegistry.Service
  729. const contexts: Tool.Context[] = []
  730. yield* registry.register({
  731. location_context: Tool.make({
  732. description: "Read application context",
  733. input: Schema.Struct({ query: Schema.String }),
  734. output: Schema.Struct({ answer: Schema.String }),
  735. execute: ({ query }, context) =>
  736. Effect.sync(() => {
  737. contexts.push(context)
  738. return { answer: query.toUpperCase() }
  739. }),
  740. }),
  741. })
  742. yield* admit(session, "Use application context")
  743. responses = [reply.tool("call-location", "location_context", { query: "hello" }), []]
  744. yield* session.resume(sessionID)
  745. expect(requests[0]?.tools.map((tool) => tool.name)).toContain("location_context")
  746. expect(contexts).toEqual([
  747. {
  748. sessionID,
  749. agent: AgentV2.ID.make("build"),
  750. assistantMessageID: expect.stringMatching(/^msg_/),
  751. toolCallID: "call-location",
  752. },
  753. ])
  754. expect(yield* session.context(sessionID)).toMatchObject([
  755. { type: "user", text: "Use application context" },
  756. {
  757. type: "assistant",
  758. content: [
  759. {
  760. type: "tool",
  761. id: "call-location",
  762. state: { status: "completed", structured: { answer: "HELLO" } },
  763. },
  764. ],
  765. },
  766. ])
  767. }),
  768. )
  769. it.effect("executes the tool advertised before a registry reload", () =>
  770. Effect.gen(function* () {
  771. const session = yield* setup
  772. const registry = yield* ToolRegistry.Service
  773. const scope = yield* Scope.make()
  774. const executions: string[] = []
  775. yield* registry
  776. .register({
  777. reloaded: Tool.make({
  778. description: "Record the advertised tool",
  779. input: Schema.Struct({}),
  780. output: Schema.Struct({ value: Schema.String }),
  781. execute: () => Effect.sync(() => executions.push("advertised")).pipe(Effect.as({ value: "advertised" })),
  782. }),
  783. })
  784. .pipe(Scope.provide(scope))
  785. yield* admit(session, "Use the reloaded tool")
  786. responses = [
  787. [
  788. LLMEvent.stepStart({ index: 0 }),
  789. LLMEvent.toolCall({ id: "call-reloaded", name: "reloaded", input: {} }),
  790. LLMEvent.stepFinish({ index: 0, reason: "tool-calls" }),
  791. LLMEvent.finish({ reason: "tool-calls" }),
  792. ],
  793. [],
  794. ]
  795. streamGate = yield* Deferred.make<void>()
  796. streamStarted = yield* Deferred.make<void>()
  797. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  798. yield* Deferred.await(streamStarted)
  799. yield* Scope.close(scope, Exit.void)
  800. yield* registry.register({
  801. reloaded: Tool.make({
  802. description: "Record the replacement tool",
  803. input: Schema.Struct({}),
  804. output: Schema.Struct({ value: Schema.String }),
  805. execute: () => Effect.sync(() => executions.push("replacement")).pipe(Effect.as({ value: "replacement" })),
  806. }),
  807. })
  808. yield* Deferred.succeed(streamGate, undefined)
  809. yield* Fiber.join(run)
  810. expect(executions).toEqual(["advertised"])
  811. expect(yield* session.context(sessionID)).toMatchObject([
  812. { type: "user", text: "Use the reloaded tool" },
  813. {
  814. type: "assistant",
  815. content: [
  816. {
  817. type: "tool",
  818. id: "call-reloaded",
  819. state: { status: "completed", structured: { value: "advertised" } },
  820. },
  821. ],
  822. },
  823. ])
  824. }),
  825. )
  826. it.effect("starts a real runner step after default prompt recording", () =>
  827. Effect.gen(function* () {
  828. const session = yield* setup
  829. const message = yield* session.prompt({
  830. sessionID,
  831. text: "Run automatically",
  832. })
  833. yield* session.wait(sessionID)
  834. expect(requests).toHaveLength(1)
  835. expect(yield* session.messages({ sessionID })).toMatchObject([
  836. { id: message.id, type: "user", text: "Run automatically" },
  837. ])
  838. }),
  839. )
  840. it.effect("runs a follow-up when synthetic input arrives during an active continuation", () =>
  841. Effect.gen(function* () {
  842. const session = yield* setup
  843. const secondStarted = yield* Deferred.make<void>()
  844. const releaseSecond = yield* Deferred.make<void>()
  845. responseStreams = [
  846. Stream.fromIterable(reply.tool("call-echo", "echo", { text: "background started" })),
  847. Stream.unwrap(
  848. Deferred.succeed(secondStarted, undefined).pipe(
  849. Effect.andThen(Deferred.await(releaseSecond)),
  850. Effect.as(Stream.fromIterable(reply.stop())),
  851. ),
  852. ),
  853. Stream.fromIterable(reply.text("Handled completion", "text-completion")),
  854. ]
  855. yield* admit(session, "Start background work")
  856. const running = yield* session.resume(sessionID).pipe(Effect.forkChild({ startImmediately: true }))
  857. yield* Deferred.await(secondStarted)
  858. yield* session.synthetic({ sessionID, text: "Background work completed" })
  859. yield* Deferred.succeed(releaseSecond, undefined)
  860. yield* Fiber.join(running)
  861. expect(requests).toHaveLength(3)
  862. expect(userTexts(requests[2]!)).toContain("Background work completed")
  863. }),
  864. )
  865. it.effect("streams one request with registry definitions from chronological V2 user history", () =>
  866. Effect.gen(function* () {
  867. const session = yield* setup
  868. yield* admit(session, "First")
  869. yield* admit(session, "Second")
  870. yield* session.resume(sessionID)
  871. expect(requests).toHaveLength(1)
  872. expect(requests[0]?.model).toBe(model)
  873. expect(requests[0]?.tools.map((tool) => tool.name)).toEqual(["echo", "defect", "storefail"])
  874. expect(requests[0]?.messages.map((message) => ({ role: message.role, content: message.content }))).toEqual([
  875. { role: "user", content: [{ type: "text", text: "First" }] },
  876. { role: "user", content: [{ type: "text", text: "Second" }] },
  877. ])
  878. expect(yield* session.messages({ sessionID })).toHaveLength(2)
  879. }),
  880. )
  881. it.effect("retries the first request after system context becomes available", () =>
  882. Effect.gen(function* () {
  883. const session = yield* setup
  884. const { db } = yield* Database.Service
  885. const messageID = SessionMessage.ID.create()
  886. systemUnavailable = true
  887. yield* session.prompt({
  888. id: messageID,
  889. sessionID,
  890. text: "First",
  891. resume: false,
  892. })
  893. const exit = yield* session.resume(sessionID).pipe(Effect.exit)
  894. expect(Exit.isFailure(exit)).toBe(true)
  895. if (Exit.isFailure(exit)) expect(Cause.squash(exit.cause)).toBeInstanceOf(Instructions.InitializationBlocked)
  896. expect(requests).toHaveLength(0)
  897. expect(yield* SessionPending.has(db, sessionID, "steer")).toBe(true)
  898. expect(
  899. yield* db.select().from(InstructionStateTable).where(eq(InstructionStateTable.session_id, sessionID)).get(),
  900. ).toBeUndefined()
  901. systemUnavailable = false
  902. yield* session.prompt({ id: messageID, sessionID, text: "First" })
  903. yield* session.wait(sessionID)
  904. expect(requests).toHaveLength(1)
  905. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user"])
  906. }),
  907. )
  908. it.effect("interrupts a source Location runner after a Session moves", () =>
  909. Effect.gen(function* () {
  910. const session = yield* setup
  911. const events = yield* EventV2.Service
  912. const { db } = yield* Database.Service
  913. yield* admit(session, "First")
  914. yield* session.resume(sessionID)
  915. yield* events.publish(SessionEvent.Moved, {
  916. sessionID,
  917. location: Location.Ref.make({ directory: AbsolutePath.make("/moved") }),
  918. })
  919. expect(
  920. yield* db.select().from(InstructionStateTable).where(eq(InstructionStateTable.session_id, sessionID)).get(),
  921. ).toBeUndefined()
  922. yield* admit(session, "Second")
  923. const exit = yield* session.resume(sessionID).pipe(Effect.exit)
  924. expect(Exit.isFailure(exit) && Cause.hasInterruptsOnly(exit.cause)).toBe(true)
  925. expect(requests).toHaveLength(1)
  926. expect(yield* SessionPending.has(db, sessionID, "steer")).toBe(true)
  927. }),
  928. )
  929. it.effect("forks instruction values at the selected message instead of the parent's latest state", () =>
  930. Effect.gen(function* () {
  931. const session = yield* setup
  932. const first = yield* admit(session, "First")
  933. yield* session.resume(sessionID)
  934. systemBaseline = "Changed context"
  935. const second = yield* admit(session, "Second")
  936. yield* session.resume(sessionID)
  937. systemBaseline = "Latest context"
  938. yield* admit(session, "Third")
  939. yield* session.resume(sessionID)
  940. const forked = yield* session.fork({ sessionID, messageID: second.id })
  941. expect(
  942. yield* (yield* Database.Service).db
  943. .select()
  944. .from(InstructionStateTable)
  945. .where(eq(InstructionStateTable.session_id, forked.id))
  946. .get(),
  947. ).toMatchObject({
  948. initial_values: { "test/context": Instructions.hash("Initial context") },
  949. current_values: { "test/context": Instructions.hash("Changed context") },
  950. })
  951. yield* session.prompt({ sessionID: forked.id, text: "Forked", resume: false })
  952. yield* session.resume(forked.id)
  953. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual([defaultSystem, "Initial context"])
  954. expect(systemTexts(requests.at(-1)!)).toContain("Changed context")
  955. expect(systemTexts(requests.at(-1)!)).toContain("Latest context")
  956. const { db } = yield* Database.Service
  957. const events = yield* EventV2.Service
  958. const recorded = yield* db
  959. .select()
  960. .from(EventTable)
  961. .where(eq(EventTable.aggregate_id, forked.id))
  962. .orderBy(asc(EventTable.seq))
  963. .all()
  964. yield* events.remove(forked.id)
  965. yield* db.delete(SessionTable).where(eq(SessionTable.id, forked.id)).run()
  966. yield* events.replayAll(
  967. recorded.map((event) => ({
  968. id: event.id,
  969. created: DateTime.makeUnsafe(event.created),
  970. aggregateID: event.aggregate_id,
  971. seq: event.seq,
  972. type: event.type,
  973. data: event.data,
  974. })),
  975. )
  976. expect(
  977. yield* db.select().from(InstructionStateTable).where(eq(InstructionStateTable.session_id, forked.id)).get(),
  978. ).toMatchObject({ current_values: { "test/context": Instructions.hash("Latest context") } })
  979. }),
  980. )
  981. it.effect("caps nested fork instruction ancestry at the selected message", () =>
  982. Effect.gen(function* () {
  983. const session = yield* setup
  984. yield* admit(session, "First")
  985. yield* session.resume(sessionID)
  986. systemBaseline = "Changed context"
  987. const second = yield* admit(session, "Second")
  988. yield* session.resume(sessionID)
  989. const child = yield* session.fork({ sessionID, messageID: second.id })
  990. const inheritedFirst = (yield* session.messages({ sessionID: child.id })).find(
  991. (message) => message.type === "user" && message.text === "First",
  992. )
  993. if (!inheritedFirst) return yield* Effect.die(new Error("Nested fork boundary message not found"))
  994. const grandchild = yield* session.fork({ sessionID: child.id, messageID: inheritedFirst.id })
  995. expect(
  996. yield* (yield* Database.Service).db
  997. .select()
  998. .from(InstructionStateTable)
  999. .where(eq(InstructionStateTable.session_id, grandchild.id))
  1000. .get(),
  1001. ).toMatchObject({
  1002. initial_values: { "test/context": Instructions.hash("Initial context") },
  1003. current_values: { "test/context": Instructions.hash("Initial context") },
  1004. })
  1005. }),
  1006. )
  1007. it.effect("rebuilds a missing instruction cache without admitting another delta", () =>
  1008. Effect.gen(function* () {
  1009. const session = yield* setup
  1010. const { db } = yield* Database.Service
  1011. yield* admit(session, "First")
  1012. yield* session.resume(sessionID)
  1013. yield* db.delete(InstructionStateTable).where(eq(InstructionStateTable.session_id, sessionID)).run()
  1014. yield* admit(session, "Second")
  1015. requests.length = 0
  1016. yield* session.resume(sessionID)
  1017. expect(requests).toHaveLength(1)
  1018. expect(requests[0]?.system.map((part) => part.text)).toEqual([defaultSystem, "Initial context"])
  1019. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user", "user"])
  1020. expect(
  1021. yield* db
  1022. .select({ id: EventTable.id })
  1023. .from(EventTable)
  1024. .where(eq(EventTable.type, "session.instructions.updated.2"))
  1025. .all(),
  1026. ).toHaveLength(1)
  1027. expect(yield* db.select().from(InstructionStateTable).get()).toMatchObject({
  1028. initial_values: { "test/context": Instructions.hash("Initial context") },
  1029. current_values: { "test/context": Instructions.hash("Initial context") },
  1030. })
  1031. }),
  1032. )
  1033. it.effect("keeps the initial instructions stable and derives a chronological update from values", () =>
  1034. Effect.gen(function* () {
  1035. const session = yield* setup
  1036. yield* admit(session, "First")
  1037. yield* session.resume(sessionID)
  1038. systemBaseline = "Changed context"
  1039. yield* admit(session, "Second")
  1040. yield* session.resume(sessionID)
  1041. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1042. [defaultSystem, "Initial context"],
  1043. [defaultSystem, "Initial context"],
  1044. ])
  1045. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "system", "user"])
  1046. expect(requests[1]?.messages.at(1)?.content).toEqual([{ type: "text", text: "Changed context" }])
  1047. expect(yield* session.messages({ sessionID })).toHaveLength(2)
  1048. const { db } = yield* Database.Service
  1049. const updates = yield* db
  1050. .select({ data: EventTable.data })
  1051. .from(EventTable)
  1052. .where(eq(EventTable.type, "session.instructions.updated.2"))
  1053. .orderBy(asc(EventTable.seq))
  1054. .all()
  1055. .pipe(Effect.orDie)
  1056. expect(updates).toHaveLength(2)
  1057. expect(updates[0]?.data).toEqual({
  1058. sessionID,
  1059. delta: { "test/context": Instructions.hash("Initial context") },
  1060. })
  1061. expect(updates[1]?.data).toEqual({
  1062. sessionID,
  1063. delta: { "test/context": Instructions.hash("Changed context") },
  1064. })
  1065. yield* replaySessionProjection(sessionID)
  1066. expect(yield* session.messages({ sessionID })).toHaveLength(2)
  1067. }),
  1068. )
  1069. it.effect("uses the selected model family prompt when the agent does not override it", () =>
  1070. Effect.gen(function* () {
  1071. const session = yield* setup
  1072. currentModel = Model.make({ id: "gpt-5", provider: "openai", route: OpenAIChat.route })
  1073. yield* admit(session, "First")
  1074. response = reply.text("Done", "text-provider-prompt")
  1075. yield* session.resume(sessionID)
  1076. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual([
  1077. expect.stringContaining("You are OpenCode, You and the user share the same workspace"),
  1078. "Initial context",
  1079. ])
  1080. }),
  1081. )
  1082. it.effect("uses the selected model family prompt when the agent system override is empty", () =>
  1083. Effect.gen(function* () {
  1084. const session = yield* setup
  1085. currentModel = Model.make({ id: "gpt-5", provider: "openai", route: OpenAIChat.route })
  1086. const agent = yield* AgentV2.Service
  1087. yield* agent.transform((editor) =>
  1088. editor.update(AgentV2.ID.make("build"), (agent) => {
  1089. agent.system = ""
  1090. agent.mode = "primary"
  1091. }),
  1092. )
  1093. yield* admit(session, "First")
  1094. response = reply.text("Done", "text-empty-agent-system")
  1095. yield* session.resume(sessionID)
  1096. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual([
  1097. expect.stringContaining("You are OpenCode, You and the user share the same workspace"),
  1098. "Initial context",
  1099. ])
  1100. }),
  1101. )
  1102. it.effect("includes the effective default agent system before durable context", () =>
  1103. Effect.gen(function* () {
  1104. const session = yield* setup
  1105. const agent = yield* AgentV2.Service
  1106. yield* agent.transform((editor) =>
  1107. editor.update(AgentV2.ID.make("build"), (agent) => {
  1108. agent.system = "Build agent instructions"
  1109. agent.mode = "primary"
  1110. }),
  1111. )
  1112. yield* admit(session, "First")
  1113. response = reply.text("Done", "text-build")
  1114. yield* session.resume(sessionID)
  1115. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual(["Build agent instructions", "Initial context"])
  1116. }),
  1117. )
  1118. it.effect("uses the configured default agent system for omitted-agent sessions", () =>
  1119. Effect.gen(function* () {
  1120. const session = yield* setup
  1121. const agent = yield* AgentV2.Service
  1122. yield* agent.transform((editor) => {
  1123. editor.update(AgentV2.ID.make("build"), (agent) => {
  1124. agent.system = "Build agent instructions"
  1125. agent.mode = "primary"
  1126. })
  1127. editor.update(AgentV2.ID.make("reviewer"), (agent) => {
  1128. agent.system = "Reviewer instructions"
  1129. agent.mode = "primary"
  1130. })
  1131. editor.default(AgentV2.ID.make("reviewer"))
  1132. })
  1133. yield* admit(session, "First")
  1134. response = reply.text("Done", "text-reviewer")
  1135. yield* session.resume(sessionID)
  1136. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual(["Reviewer instructions", "Initial context"])
  1137. expect((yield* session.messages({ sessionID }))[0]).toMatchObject({ type: "assistant", agent: "reviewer" })
  1138. }),
  1139. )
  1140. it.effect("uses only the agent prompt and initial instructions as system parts", () =>
  1141. Effect.gen(function* () {
  1142. const session = yield* setup
  1143. const agent = yield* AgentV2.Service
  1144. yield* agent.transform((editor) =>
  1145. editor.update(AgentV2.ID.make("build"), (agent) => {
  1146. agent.system = "Build agent instructions"
  1147. agent.mode = "primary"
  1148. }),
  1149. )
  1150. yield* admit(session, "First")
  1151. response = reply.text("Done", "text-no-system")
  1152. yield* session.resume(sessionID)
  1153. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual(["Build agent instructions", "Initial context"])
  1154. }),
  1155. )
  1156. it.effect("uses an explicitly selected non-build agent system", () =>
  1157. Effect.gen(function* () {
  1158. const session = yield* setup
  1159. const { db } = yield* Database.Service
  1160. const agent = yield* AgentV2.Service
  1161. yield* agent.transform((editor) =>
  1162. editor.update(AgentV2.ID.make("reviewer"), (agent) => {
  1163. agent.system = "Reviewer instructions"
  1164. agent.mode = "primary"
  1165. }),
  1166. )
  1167. yield* db
  1168. .update(SessionTable)
  1169. .set({ agent: "reviewer" })
  1170. .where(eq(SessionTable.id, sessionID))
  1171. .run()
  1172. .pipe(Effect.orDie)
  1173. yield* admit(session, "First")
  1174. response = reply.text("Done", "text-selected")
  1175. yield* session.resume(sessionID)
  1176. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual(["Reviewer instructions", "Initial context"])
  1177. expect((yield* session.messages({ sessionID }))[0]).toMatchObject({ type: "assistant", agent: "reviewer" })
  1178. }),
  1179. )
  1180. it.effect("fails before the model request when the selected agent is unavailable", () =>
  1181. Effect.gen(function* () {
  1182. yield* setup
  1183. const { db } = yield* Database.Service
  1184. yield* db
  1185. .update(SessionTable)
  1186. .set({ agent: "explore" })
  1187. .where(eq(SessionTable.id, sessionID))
  1188. .run()
  1189. .pipe(Effect.orDie)
  1190. const session = yield* SessionV2.Service
  1191. yield* session.prompt({ sessionID, text: "Inspect files", resume: false })
  1192. requests.length = 0
  1193. response = []
  1194. const failure = yield* session.resume(sessionID).pipe(Effect.flip)
  1195. expect(failure).toMatchObject({
  1196. _tag: "Session.AgentNotFoundError",
  1197. sessionID,
  1198. agent: "explore",
  1199. })
  1200. expect(requests).toHaveLength(0)
  1201. }),
  1202. )
  1203. it.effect("waits for initial plugin readiness before constructing the model request", () =>
  1204. Effect.gen(function* () {
  1205. yield* setup
  1206. const release = yield* Deferred.make<void>()
  1207. pluginFlushHook = Deferred.await(release)
  1208. const session = yield* SessionV2.Service
  1209. yield* session.prompt({ sessionID, text: "Wait for plugins", resume: false })
  1210. requests.length = 0
  1211. response = []
  1212. const running = yield* session.resume(sessionID).pipe(Effect.forkChild({ startImmediately: true }))
  1213. yield* Effect.yieldNow
  1214. expect(requests).toHaveLength(0)
  1215. expect(running.pollUnsafe()).toBeUndefined()
  1216. yield* Deferred.succeed(release, undefined)
  1217. yield* Fiber.join(running)
  1218. expect(requests).toHaveLength(1)
  1219. }),
  1220. )
  1221. it.effect("updates selected-agent skill guidance after an agent switch", () =>
  1222. Effect.gen(function* () {
  1223. const session = yield* setup
  1224. const events = yield* EventV2.Service
  1225. const agents = yield* AgentV2.Service
  1226. yield* agents.transform((draft) =>
  1227. draft.update(AgentV2.ID.make("reviewer"), (agent) => {
  1228. agent.mode = "primary"
  1229. }),
  1230. )
  1231. skillBaselines.set(AgentV2.ID.make("build"), "Build skills")
  1232. yield* admit(session, "First")
  1233. yield* session.resume(sessionID)
  1234. skillBaselines.set(AgentV2.ID.make("reviewer"), "Reviewer skills")
  1235. yield* events.publish(SessionEvent.AgentSelected, {
  1236. sessionID,
  1237. agent: AgentV2.ID.make("reviewer"),
  1238. })
  1239. yield* admit(session, "Second")
  1240. yield* session.resume(sessionID)
  1241. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1242. [defaultSystem, "Initial context\n\nBuild skills"],
  1243. [defaultSystem, "Initial context\n\nBuild skills"],
  1244. ])
  1245. expect(systemTexts(requests[1]!)).toContainEqual(expect.stringContaining("Reviewer skills"))
  1246. }),
  1247. )
  1248. it.effect("keeps the sampled agent when selection changes during observation", () =>
  1249. Effect.gen(function* () {
  1250. const session = yield* setup
  1251. const events = yield* EventV2.Service
  1252. skillBaselines.set(AgentV2.ID.make("build"), "Build skills")
  1253. skillBaselines.set(AgentV2.ID.make("reviewer"), "Reviewer skills")
  1254. let switched = false
  1255. systemLoadHook = Effect.suspend(() => {
  1256. if (switched) return Effect.void
  1257. switched = true
  1258. return events
  1259. .publish(SessionEvent.AgentSelected, {
  1260. sessionID,
  1261. agent: AgentV2.ID.make("reviewer"),
  1262. })
  1263. .pipe(Effect.asVoid)
  1264. })
  1265. yield* admit(session, "First")
  1266. yield* session.resume(sessionID)
  1267. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1268. [defaultSystem, "Initial context\n\nBuild skills"],
  1269. ])
  1270. }),
  1271. )
  1272. it.effect("keeps the sampled model when selection changes during model resolution", () =>
  1273. Effect.gen(function* () {
  1274. const session = yield* setup
  1275. const events = yield* EventV2.Service
  1276. let switched = false
  1277. modelResolveHook = Effect.suspend(() => {
  1278. if (switched) return Effect.void
  1279. switched = true
  1280. return events
  1281. .publish(SessionEvent.ModelSelected, {
  1282. sessionID,
  1283. model: { id: ModelV2.ID.make("replacement"), providerID: ProviderV2.ID.make("fake") },
  1284. })
  1285. .pipe(Effect.asVoid)
  1286. })
  1287. yield* admit(session, "First")
  1288. yield* session.resume(sessionID)
  1289. expect(requests.map((request) => request.model)).toEqual([model])
  1290. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1291. [defaultSystem, "Initial context"],
  1292. ])
  1293. }),
  1294. )
  1295. it.effect("admits removed context as a chronological System message", () =>
  1296. Effect.gen(function* () {
  1297. const session = yield* setup
  1298. yield* admit(session, "First")
  1299. yield* session.resume(sessionID)
  1300. systemRemoved = true
  1301. yield* admit(session, "Second")
  1302. yield* session.resume(sessionID)
  1303. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "system", "user"])
  1304. expect(requests[1]?.messages.at(1)?.content).toEqual([
  1305. { type: "text", text: "System context source removed: test/context" },
  1306. ])
  1307. expect(yield* session.messages({ sessionID })).toHaveLength(2)
  1308. }),
  1309. )
  1310. it.effect("renders API context entries through add, change, and removal", () =>
  1311. Effect.gen(function* () {
  1312. const session = yield* setup
  1313. const contextEntries = yield* InstructionEntry.Service
  1314. yield* contextEntries.put({ sessionID, key: "deploy-target", value: "production" })
  1315. yield* admit(session, "First")
  1316. yield* session.resume(sessionID)
  1317. // String values render verbatim inside the initial tagged block.
  1318. expect(requests[0]?.system.map((part) => part.text)).toEqual([
  1319. defaultSystem,
  1320. ["Initial context", "", '<context key="deploy-target">', "production", "</context>"].join("\n"),
  1321. ])
  1322. // Non-string JSON pretty-prints; the change narrates as a System update.
  1323. yield* contextEntries.put({ sessionID, key: "deploy-target", value: { region: "us-east-1" } })
  1324. yield* admit(session, "Second")
  1325. yield* session.resume(sessionID)
  1326. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "system", "user"])
  1327. expect(requests[1]?.messages.at(1)?.content).toEqual([
  1328. {
  1329. type: "text",
  1330. text: [
  1331. 'The context under "deploy-target" changed and supersedes the previous value:',
  1332. '<context key="deploy-target">',
  1333. "{",
  1334. ' "region": "us-east-1"',
  1335. "}",
  1336. "</context>",
  1337. ].join("\n"),
  1338. },
  1339. ])
  1340. expect(yield* contextEntries.list(sessionID)).toEqual([{ key: "deploy-target", value: { region: "us-east-1" } }])
  1341. // Deleting the row announces removal through the stored removal text.
  1342. yield* contextEntries.remove({ sessionID, key: "deploy-target" })
  1343. yield* admit(session, "Third")
  1344. yield* session.resume(sessionID)
  1345. expect(requests[2]?.messages.map((message) => message.role)).toEqual(["user", "system", "user", "system", "user"])
  1346. expect(requests[2]?.messages.at(-2)?.content).toEqual([
  1347. { type: "text", text: 'The context under "deploy-target" no longer applies. Disregard it.' },
  1348. ])
  1349. expect(yield* contextEntries.list(sessionID)).toEqual([])
  1350. }),
  1351. )
  1352. it.effect("retains JSON null API entries as values", () =>
  1353. Effect.gen(function* () {
  1354. const session = yield* setup
  1355. const entries = yield* InstructionEntry.Service
  1356. yield* entries.put({ sessionID, key: "nullable", value: "present" })
  1357. yield* admit(session, "First")
  1358. yield* session.resume(sessionID)
  1359. yield* entries.put({ sessionID, key: "nullable", value: null })
  1360. yield* admit(session, "Second")
  1361. yield* session.resume(sessionID)
  1362. expect(requests[1]?.messages.at(1)?.content).toEqual([
  1363. {
  1364. type: "text",
  1365. text: [
  1366. 'The context under "nullable" changed and supersedes the previous value:',
  1367. '<context key="nullable">',
  1368. "null",
  1369. "</context>",
  1370. ].join("\n"),
  1371. },
  1372. ])
  1373. expect(yield* entries.list(sessionID)).toEqual([{ key: "nullable", value: null }])
  1374. }),
  1375. )
  1376. it.effect("rejects API instruction entries larger than 8KB", () =>
  1377. Effect.gen(function* () {
  1378. yield* setup
  1379. const entries = yield* InstructionEntry.Service
  1380. const exit = yield* entries
  1381. .put({ sessionID, key: "oversized", value: "x".repeat(InstructionEntry.MaxValueBytes) })
  1382. .pipe(Effect.exit)
  1383. expect(Exit.isFailure(exit)).toBe(true)
  1384. if (Exit.isFailure(exit)) expect(Cause.squash(exit.cause)).toBeInstanceOf(InstructionEntry.ValueTooLargeError)
  1385. expect(yield* entries.list(sessionID)).toEqual([])
  1386. }),
  1387. )
  1388. it.effect("keeps initial instructions and chronological updates after a model switch", () =>
  1389. Effect.gen(function* () {
  1390. const session = yield* setup
  1391. const events = yield* EventV2.Service
  1392. yield* admit(session, "First")
  1393. yield* session.resume(sessionID)
  1394. systemBaseline = "Changed context"
  1395. yield* admit(session, "Second")
  1396. yield* session.resume(sessionID)
  1397. yield* events.publish(SessionEvent.ModelSelected, {
  1398. sessionID,
  1399. model: { id: ModelV2.ID.make("replacement"), providerID: ProviderV2.ID.make("fake") },
  1400. })
  1401. systemBaseline = "Replacement context"
  1402. yield* admit(session, "Third")
  1403. yield* session.resume(sessionID)
  1404. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1405. [defaultSystem, "Initial context"],
  1406. [defaultSystem, "Initial context"],
  1407. [defaultSystem, "Initial context"],
  1408. ])
  1409. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "system", "user"])
  1410. expect(requests[2]?.messages.filter((message) => message.role === "system")).toHaveLength(2)
  1411. expect((yield* session.context(sessionID)).map((message) => message.type)).toEqual([
  1412. "user",
  1413. "user",
  1414. "model-switched",
  1415. "user",
  1416. ])
  1417. yield* replaySessionProjection(sessionID)
  1418. expect(yield* session.messages({ sessionID })).toHaveLength(4)
  1419. yield* admit(session, "Fourth")
  1420. yield* session.resume(sessionID)
  1421. }),
  1422. )
  1423. it.effect("preserves instruction values while a source is temporarily unavailable", () =>
  1424. Effect.gen(function* () {
  1425. const session = yield* setup
  1426. const events = yield* EventV2.Service
  1427. yield* admit(session, "First")
  1428. yield* session.resume(sessionID)
  1429. yield* events.publish(SessionEvent.ModelSelected, {
  1430. sessionID,
  1431. model: { id: ModelV2.ID.make("replacement"), providerID: ProviderV2.ID.make("fake") },
  1432. })
  1433. systemUnavailable = true
  1434. yield* admit(session, "Second")
  1435. yield* session.resume(sessionID)
  1436. systemUnavailable = false
  1437. systemBaseline = "Replacement context"
  1438. yield* admit(session, "Third")
  1439. yield* session.resume(sessionID)
  1440. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1441. [defaultSystem, "Initial context"],
  1442. [defaultSystem, "Initial context"],
  1443. [defaultSystem, "Initial context"],
  1444. ])
  1445. }),
  1446. )
  1447. it.effect("moves the epoch at compaction and narrates later changes", () =>
  1448. Effect.gen(function* () {
  1449. const session = yield* setup
  1450. const events = yield* EventV2.Service
  1451. yield* admit(session, "First")
  1452. yield* session.resume(sessionID)
  1453. yield* events.publish(SessionEvent.Compaction.Started, {
  1454. sessionID,
  1455. reason: "manual",
  1456. recent: "",
  1457. })
  1458. yield* events.publish(SessionEvent.Compaction.Ended, {
  1459. sessionID,
  1460. reason: "manual",
  1461. text: "summary",
  1462. recent: "",
  1463. })
  1464. systemBaseline = "Replacement context"
  1465. yield* admit(session, "Second")
  1466. yield* session.resume(sessionID)
  1467. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  1468. [defaultSystem, "Initial context"],
  1469. [defaultSystem, "Initial context"],
  1470. ])
  1471. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "system", "user"])
  1472. expect(requests[1]?.messages.at(1)?.content).toEqual([{ type: "text", text: "Replacement context" }])
  1473. yield* replaySessionProjection(sessionID)
  1474. yield* admit(session, "Third")
  1475. yield* session.resume(sessionID)
  1476. }),
  1477. )
  1478. it.effect("runs one durable compaction barrier before later steer and queued prompts", () =>
  1479. Effect.gen(function* () {
  1480. const session = yield* setup
  1481. currentModel = recoveryModel
  1482. streamGate = yield* Deferred.make<void>()
  1483. streamStarted = yield* Deferred.make<void>()
  1484. responses = [
  1485. reply.text("Active complete", "text-active"),
  1486. [LLMEvent.textDelta({ id: "summary", text: "durable summary" })],
  1487. reply.text("Steer complete", "text-steer"),
  1488. reply.text("Queue complete", "text-queue"),
  1489. ]
  1490. yield* admit(session, "Active work")
  1491. const active = yield* session.resume(sessionID).pipe(Effect.forkChild)
  1492. yield* Deferred.await(streamStarted)
  1493. const first = yield* session.compact({ sessionID })
  1494. const second = yield* session.compact({ sessionID })
  1495. expect(second.id).toBe(first.id)
  1496. expect(yield* SessionPending.compaction((yield* Database.Service).db, sessionID)).toMatchObject({
  1497. id: first.id,
  1498. })
  1499. expect((yield* session.messages({ sessionID })).find((message) => message.id === first.id)).toBeUndefined()
  1500. yield* admit(session, "Steer after compaction")
  1501. yield* session.synthetic({ sessionID, text: "Completion after compaction", resume: false })
  1502. yield* session.prompt({
  1503. sessionID,
  1504. text: "Queue after compaction",
  1505. delivery: "queue",
  1506. resume: false,
  1507. })
  1508. expect(yield* SessionPending.has((yield* Database.Service).db, sessionID, "steer")).toBe(false)
  1509. yield* Deferred.succeed(streamGate, undefined)
  1510. yield* Fiber.join(active)
  1511. expect(requests).toHaveLength(4)
  1512. expect(userTexts(requests[1])[0]).toContain("Create a new anchored summary")
  1513. expect(userTexts(requests[2])).toContain("Steer after compaction")
  1514. expect(userTexts(requests[2])).toContain("Completion after compaction")
  1515. expect(userTexts(requests[3])).toContain("Queue after compaction")
  1516. expect(yield* SessionPending.compaction((yield* Database.Service).db, sessionID)).toBeUndefined()
  1517. expect((yield* session.messages({ sessionID })).find((message) => message.id === first.id)).toMatchObject({
  1518. type: "compaction",
  1519. status: "completed",
  1520. summary: "durable summary",
  1521. })
  1522. }),
  1523. )
  1524. it.effect("releases queued prompts when durable compaction fails", () =>
  1525. Effect.gen(function* () {
  1526. const session = yield* setup
  1527. currentModel = recoveryModel
  1528. streamGate = yield* Deferred.make<void>()
  1529. streamStarted = yield* Deferred.make<void>()
  1530. responses = [
  1531. reply.text("Active complete", "text-active-failure"),
  1532. [],
  1533. reply.text("Continued", "text-after-failure"),
  1534. ]
  1535. yield* admit(session, "Active work")
  1536. const active = yield* session.resume(sessionID).pipe(Effect.forkChild)
  1537. yield* Deferred.await(streamStarted)
  1538. const compaction = yield* session.compact({ sessionID })
  1539. yield* session.prompt({
  1540. sessionID,
  1541. text: "Continue after failure",
  1542. delivery: "queue",
  1543. resume: false,
  1544. })
  1545. yield* Deferred.succeed(streamGate, undefined)
  1546. yield* Fiber.join(active)
  1547. expect(requests).toHaveLength(3)
  1548. expect(userTexts(requests[2])).toContain("Continue after failure")
  1549. expect(yield* SessionPending.compaction((yield* Database.Service).db, sessionID)).toBeUndefined()
  1550. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1551. type: "compaction",
  1552. status: "failed",
  1553. })
  1554. expect(
  1555. (yield* recordedEventTypes(sessionID)).filter(
  1556. (type) => type === EventV2.versionedType(SessionEvent.Compaction.Failed.type, 1),
  1557. ),
  1558. ).toHaveLength(1)
  1559. }),
  1560. )
  1561. it.effect("explains when manual compaction has no history", () =>
  1562. Effect.gen(function* () {
  1563. yield* setup
  1564. const session = yield* SessionV2.Service
  1565. const compaction = yield* session.compact({ sessionID })
  1566. modelResolveHook = Effect.die("model resolution should not run")
  1567. yield* session.resume(sessionID)
  1568. expect(yield* SessionPending.compaction((yield* Database.Service).db, sessionID)).toBeUndefined()
  1569. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1570. type: "compaction",
  1571. status: "failed",
  1572. reason: "manual",
  1573. error: { type: "compaction.unavailable", message: "Nothing to compact yet" },
  1574. })
  1575. expect(
  1576. (yield* recordedEventTypes(sessionID)).filter(
  1577. (type) => type === EventV2.versionedType(SessionEvent.Compaction.Failed.type, 1),
  1578. ),
  1579. ).toHaveLength(1)
  1580. }),
  1581. )
  1582. it.effect("manually compacts when the model has no context limit", () =>
  1583. Effect.gen(function* () {
  1584. const session = yield* setup
  1585. response = reply.text("Earlier answer", "text-manual-unknown-history")
  1586. yield* admit(session, "Earlier question")
  1587. yield* session.resume(sessionID)
  1588. requests.length = 0
  1589. response = reply.text("Manual summary", "text-manual-unknown-summary")
  1590. const compaction = yield* session.compact({ sessionID })
  1591. yield* session.resume(sessionID)
  1592. expect(requests).toHaveLength(1)
  1593. expect(userTexts(requests[0])[0]).toContain("Earlier question")
  1594. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1595. type: "compaction",
  1596. status: "completed",
  1597. summary: "Manual summary",
  1598. })
  1599. }),
  1600. )
  1601. it.effect("preserves provider errors from manual compaction", () =>
  1602. Effect.gen(function* () {
  1603. const session = yield* setup
  1604. response = reply.text("Earlier answer", "text-manual-provider-history")
  1605. yield* admit(session, "Earlier question")
  1606. yield* session.resume(sessionID)
  1607. response = [LLMEvent.providerError({ message: "summary unavailable" })]
  1608. const compaction = yield* session.compact({ sessionID })
  1609. yield* session.resume(sessionID)
  1610. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1611. type: "compaction",
  1612. status: "failed",
  1613. error: { type: "provider.error", message: "summary unavailable" },
  1614. })
  1615. }),
  1616. )
  1617. it.effect("preserves typed provider failures from manual compaction", () =>
  1618. Effect.gen(function* () {
  1619. const session = yield* setup
  1620. response = reply.text("Earlier answer", "text-manual-failure-history")
  1621. yield* admit(session, "Earlier question")
  1622. yield* session.resume(sessionID)
  1623. responseStream = Stream.fail(providerUnavailable())
  1624. const compaction = yield* session.compact({ sessionID })
  1625. yield* session.resume(sessionID)
  1626. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1627. type: "compaction",
  1628. status: "failed",
  1629. error: { type: "provider.transport", message: "Provider unavailable" },
  1630. })
  1631. }),
  1632. )
  1633. it.effect("settles an admitted manual compaction when pre-start resolution throws", () =>
  1634. Effect.gen(function* () {
  1635. const session = yield* setup
  1636. response = reply.text("Earlier answer", "text-manual-resolution-history")
  1637. yield* admit(session, "Earlier question")
  1638. yield* session.resume(sessionID)
  1639. const compaction = yield* session.compact({ sessionID })
  1640. modelResolveHook = Effect.die("model resolution failed")
  1641. expect(yield* Effect.exit(session.resume(sessionID))).toMatchObject({ _tag: "Failure" })
  1642. expect(yield* SessionPending.compaction((yield* Database.Service).db, sessionID)).toBeUndefined()
  1643. expect((yield* session.messages({ sessionID })).find((message) => message.id === compaction.id)).toMatchObject({
  1644. type: "compaction",
  1645. status: "failed",
  1646. reason: "manual",
  1647. })
  1648. expect(
  1649. (yield* recordedEventTypes(sessionID)).filter(
  1650. (type) => type === EventV2.versionedType(SessionEvent.Compaction.Failed.type, 1),
  1651. ),
  1652. ).toHaveLength(1)
  1653. }),
  1654. )
  1655. it.effect("automatically compacts into a completed summary and retained recent turn", () =>
  1656. Effect.gen(function* () {
  1657. const session = yield* setup
  1658. response = reply.textWithUsage("Earlier answer", "text-first", 3_950)
  1659. yield* admit(session, "Earlier question ".repeat(180))
  1660. yield* session.resume(sessionID)
  1661. currentModel = compactModel
  1662. requests.length = 0
  1663. responses = [
  1664. reply.text("## Objective\n- Preserve the task", "text-summary"),
  1665. reply.textWithUsage("Continued", "text-final", 3_950),
  1666. ]
  1667. yield* admit(session, "Recent exact request ".repeat(180))
  1668. yield* session.resume(sessionID)
  1669. expect(requests).toHaveLength(2)
  1670. expect(userTexts(requests[0])[0]).toContain("## Objective")
  1671. expect(userTexts(requests[1])).toHaveLength(1)
  1672. expect(userTexts(requests[1])[0]).toContain("<summary>\n## Objective\n- Preserve the task\n</summary>")
  1673. expect(userTexts(requests[1])[0]).toContain(`[User]: ${"Recent exact request ".repeat(180)}`)
  1674. const context = yield* (yield* SessionStore.Service).context(sessionID)
  1675. expect(context.map((message) => message.type)).toEqual(["compaction", "assistant"])
  1676. expect(context[0]).toMatchObject({
  1677. type: "compaction",
  1678. summary: "## Objective\n- Preserve the task",
  1679. })
  1680. requests.length = 0
  1681. executions.length = 0
  1682. responses = [
  1683. reply.text("## Objective\n- Preserve the updated task", "text-summary-2"),
  1684. reply.text("Continued again", "text-final-2"),
  1685. ]
  1686. yield* admit(session, "Newest exact request ".repeat(180))
  1687. yield* session.resume(sessionID)
  1688. expect(requests).toHaveLength(2)
  1689. expect(userTexts(requests[0])[0]).toContain(
  1690. "<previous-summary>\n## Objective\n- Preserve the task\n</previous-summary>",
  1691. )
  1692. expect(userTexts(requests[0])[0]).toContain("Recent exact request")
  1693. expect((yield* (yield* SessionStore.Service).context(sessionID))[0]).toMatchObject({
  1694. type: "compaction",
  1695. summary: "## Objective\n- Preserve the updated task",
  1696. })
  1697. }),
  1698. )
  1699. it.effect("stops after required automatic compaction fails", () =>
  1700. Effect.gen(function* () {
  1701. const session = yield* setup
  1702. response = reply.textWithUsage("Earlier answer", "text-before-failed-compaction", 3_950)
  1703. yield* admit(session, "Earlier question ".repeat(180))
  1704. yield* session.resume(sessionID)
  1705. currentModel = compactModel
  1706. requests.length = 0
  1707. responses = [
  1708. [LLMEvent.providerError({ message: "Unsupported parameter: max_output_tokens" })],
  1709. reply.text("Must not run", "text-after-failed-compaction"),
  1710. ]
  1711. yield* admit(session, "Recent exact request ".repeat(180))
  1712. expect(yield* Effect.exit(session.resume(sessionID))).toMatchObject({ _tag: "Failure" })
  1713. expect(requests).toHaveLength(1)
  1714. expect(requests[0]?.generation).toBeUndefined()
  1715. expect(yield* session.context(sessionID)).toContainEqual(
  1716. expect.objectContaining({
  1717. type: "compaction",
  1718. status: "failed",
  1719. reason: "auto",
  1720. error: expect.objectContaining({ message: "Unsupported parameter: max_output_tokens" }),
  1721. }),
  1722. )
  1723. }),
  1724. )
  1725. it.effect("forces one compaction and retries after provider context overflow", () =>
  1726. Effect.gen(function* () {
  1727. const session = yield* setupOverflowRecovery
  1728. responses = [
  1729. [
  1730. LLMEvent.stepStart({ index: 0 }),
  1731. LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" }),
  1732. ],
  1733. reply.text("## Objective\n- Recover overflow", "text-summary"),
  1734. reply.text("Recovered", "text-final"),
  1735. ]
  1736. yield* admit(session, "Continue")
  1737. yield* session.resume(sessionID)
  1738. expect(requests).toHaveLength(3)
  1739. expect(userTexts(requests[1])[0]).toContain("## Objective")
  1740. expect(userTexts(requests[2])[0]).toContain("<summary>\n## Objective\n- Recover overflow\n</summary>")
  1741. expect(yield* session.context(sessionID)).toMatchObject([
  1742. { type: "compaction", summary: "## Objective\n- Recover overflow" },
  1743. { type: "assistant", finish: "stop" },
  1744. ])
  1745. yield* replaySessionProjection(sessionID)
  1746. expect(yield* session.context(sessionID)).toMatchObject([
  1747. { type: "compaction" },
  1748. { type: "assistant", finish: "stop" },
  1749. ])
  1750. }),
  1751. )
  1752. it.effect("recovers from provider context overflow without a configured context limit", () =>
  1753. Effect.gen(function* () {
  1754. const session = yield* setupOverflowRecovery
  1755. currentModel = model
  1756. responses = [
  1757. [LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" })],
  1758. reply.text("## Objective\n- Recover unknown limit", "text-summary-unknown-limit"),
  1759. reply.text("Recovered", "text-final-unknown-limit"),
  1760. ]
  1761. yield* admit(session, "Continue")
  1762. yield* session.resume(sessionID)
  1763. expect(requests).toHaveLength(3)
  1764. expect(yield* session.context(sessionID)).toMatchObject([
  1765. { type: "compaction", summary: "## Objective\n- Recover unknown limit" },
  1766. { type: "assistant", finish: "stop" },
  1767. ])
  1768. }),
  1769. )
  1770. it.effect("recovers from provider context overflow despite an undersized configured context limit", () =>
  1771. Effect.gen(function* () {
  1772. const session = yield* setupOverflowRecovery
  1773. currentModel = undersizedContextModel
  1774. responses = [
  1775. [LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" })],
  1776. reply.text("## Objective\n- Recover undersized limit", "text-summary-undersized-limit"),
  1777. reply.text("Recovered", "text-final-undersized-limit"),
  1778. ]
  1779. yield* admit(session, "Continue")
  1780. yield* session.resume(sessionID)
  1781. expect(requests).toHaveLength(3)
  1782. expect(yield* session.context(sessionID)).toMatchObject([
  1783. { type: "compaction", summary: "## Objective\n- Recover undersized limit" },
  1784. { type: "assistant", finish: "stop" },
  1785. ])
  1786. }),
  1787. )
  1788. it.effect("persists a second context overflow after one recovery", () =>
  1789. Effect.gen(function* () {
  1790. const session = yield* setupOverflowRecovery
  1791. const overflow = () => [
  1792. LLMEvent.stepStart({ index: 0 }),
  1793. LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" }),
  1794. ]
  1795. responses = [overflow(), reply.text("## Objective\n- Recover once", "text-summary"), overflow()]
  1796. yield* admit(session, "Continue")
  1797. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("prompt too long")
  1798. expect(requests).toHaveLength(3)
  1799. expect(yield* session.context(sessionID)).toMatchObject([
  1800. { type: "compaction" },
  1801. { type: "assistant", finish: "error", error: { message: "prompt too long" } },
  1802. ])
  1803. }),
  1804. )
  1805. it.effect("recovers once from a raw context overflow failure", () =>
  1806. Effect.gen(function* () {
  1807. const session = yield* setupOverflowRecovery
  1808. responseStream = Stream.fail(
  1809. new LLMError({
  1810. module: "test",
  1811. method: "stream",
  1812. reason: new InvalidRequestReason({
  1813. message: "prompt too long",
  1814. classification: "context-overflow",
  1815. }),
  1816. }),
  1817. )
  1818. responses = [
  1819. reply.text("## Objective\n- Recover raw overflow", "text-summary"),
  1820. reply.text("Recovered", "text-final"),
  1821. ]
  1822. yield* admit(session, "Continue")
  1823. yield* session.resume(sessionID)
  1824. expect(requests).toHaveLength(3)
  1825. expect(yield* session.context(sessionID)).toMatchObject([
  1826. { type: "compaction", summary: "## Objective\n- Recover raw overflow" },
  1827. { type: "assistant", finish: "stop" },
  1828. ])
  1829. }),
  1830. )
  1831. it.effect("publishes the original overflow when recovery summarization fails", () =>
  1832. Effect.gen(function* () {
  1833. const session = yield* setupOverflowRecovery
  1834. responses = [
  1835. [LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" })],
  1836. [LLMEvent.providerError({ message: "summary unavailable" })],
  1837. ]
  1838. yield* admit(session, "Continue")
  1839. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("prompt too long")
  1840. expect(requests).toHaveLength(2)
  1841. const context = yield* session.context(sessionID)
  1842. expect(context).toContainEqual(
  1843. expect.objectContaining({
  1844. type: "compaction",
  1845. status: "failed",
  1846. reason: "auto",
  1847. error: { type: "provider.error", message: "summary unavailable" },
  1848. }),
  1849. )
  1850. expect(context.slice(-3)).toMatchObject([
  1851. { type: "user", text: "Continue" },
  1852. { type: "compaction", status: "failed", reason: "auto" },
  1853. { type: "assistant", finish: "error", error: { message: "prompt too long" } },
  1854. ])
  1855. }),
  1856. )
  1857. it.effect("interrupts overflow recovery while the summary provider is running", () =>
  1858. Effect.gen(function* () {
  1859. const session = yield* setupOverflowRecovery
  1860. responses = [
  1861. [LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" })],
  1862. reply.text("## Objective\n- Interrupted", "text-summary"),
  1863. ]
  1864. const firstGate = yield* Deferred.make<void>()
  1865. const summaryGate = yield* Deferred.make<void>()
  1866. streamGate = firstGate
  1867. yield* admit(session, "Continue")
  1868. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  1869. while (requests.length < 1) yield* Effect.yieldNow
  1870. streamGate = summaryGate
  1871. yield* Deferred.succeed(firstGate, undefined)
  1872. while (requests.length < 2) yield* Effect.yieldNow
  1873. yield* session.interrupt(sessionID)
  1874. expect(yield* Fiber.await(run)).toMatchObject({ _tag: "Failure" })
  1875. streamGate = undefined
  1876. expect(requests).toHaveLength(2)
  1877. expect(yield* session.context(sessionID)).toContainEqual(
  1878. expect.objectContaining({ type: "compaction", status: "failed", reason: "auto" }),
  1879. )
  1880. }),
  1881. )
  1882. it.effect("uses epoch values after compaction while a source is unavailable", () =>
  1883. Effect.gen(function* () {
  1884. const session = yield* setup
  1885. const events = yield* EventV2.Service
  1886. yield* admit(session, "First")
  1887. yield* session.resume(sessionID)
  1888. systemBaseline = "Changed context"
  1889. yield* admit(session, "Second")
  1890. yield* session.resume(sessionID)
  1891. yield* events.publish(SessionEvent.Compaction.Started, {
  1892. sessionID,
  1893. reason: "manual",
  1894. recent: "",
  1895. })
  1896. yield* events.publish(SessionEvent.Compaction.Ended, {
  1897. sessionID,
  1898. reason: "manual",
  1899. text: "summary",
  1900. recent: "",
  1901. })
  1902. systemUnavailable = true
  1903. yield* admit(session, "Third")
  1904. yield* session.resume(sessionID)
  1905. // Compaction already moved current values into the new epoch before the unavailable read.
  1906. expect(requests.at(-1)?.system.map((part) => part.text)).toEqual([defaultSystem, "Changed context"])
  1907. expect(systemTexts(requests.at(-1)!)).not.toContain("Changed context")
  1908. }),
  1909. )
  1910. it.effect("projects reasoning and tool events without executing or continuing tools", () =>
  1911. Effect.gen(function* () {
  1912. const session = yield* setup
  1913. yield* admit(session, "Use tools")
  1914. response = [
  1915. LLMEvent.stepStart({ index: 0 }),
  1916. LLMEvent.reasoningStart({ id: "reasoning-1" }),
  1917. LLMEvent.reasoningDelta({ id: "reasoning-1", text: "Think" }),
  1918. LLMEvent.reasoningEnd({ id: "reasoning-1" }),
  1919. LLMEvent.toolInputStart({ id: "call-error", name: "write" }),
  1920. LLMEvent.toolInputDelta({ id: "call-error", name: "write", text: '{"path":"README.md"}' }),
  1921. LLMEvent.toolInputEnd({ id: "call-error", name: "write" }),
  1922. LLMEvent.toolCall({ id: "call-error", name: "write", input: { path: "README.md" }, providerExecuted: true }),
  1923. LLMEvent.toolError({ id: "call-error", name: "write", message: "Denied" }),
  1924. LLMEvent.toolResult({ id: "call-error", name: "write", result: { type: "error", value: "Denied" } }),
  1925. LLMEvent.toolCall({
  1926. id: "call-provider",
  1927. name: "web_search",
  1928. input: { query: "hello" },
  1929. providerExecuted: true,
  1930. providerMetadata: { openai: { source: "provider" } },
  1931. }),
  1932. LLMEvent.toolResult({
  1933. id: "call-provider",
  1934. name: "web_search",
  1935. result: {
  1936. type: "content",
  1937. value: [
  1938. { type: "text", text: "Hello" },
  1939. { type: "file", uri: "data:image/png;base64,aGVsbG8=", mime: "image/png", name: "hello.png" },
  1940. ],
  1941. },
  1942. providerExecuted: true,
  1943. providerMetadata: { openai: { source: "provider" } },
  1944. }),
  1945. LLMEvent.stepFinish({
  1946. index: 0,
  1947. reason: "tool-calls",
  1948. usage: {
  1949. inputTokens: 10,
  1950. nonCachedInputTokens: 8,
  1951. outputTokens: 4,
  1952. reasoningTokens: 1,
  1953. cacheReadInputTokens: 2,
  1954. },
  1955. }),
  1956. LLMEvent.finish({ reason: "tool-calls" }),
  1957. ]
  1958. yield* session.resume(sessionID)
  1959. expect(requests).toHaveLength(1)
  1960. expect(requests[0]?.tools.map((tool) => tool.name)).toEqual(["echo", "defect", "storefail"])
  1961. expect(yield* session.context(sessionID)).toMatchObject([
  1962. { type: "user", text: "Use tools" },
  1963. {
  1964. type: "assistant",
  1965. finish: "tool-calls",
  1966. cost: 0,
  1967. tokens: { input: 8, output: 3, reasoning: 1, cache: { read: 2, write: 0 } },
  1968. content: [
  1969. { type: "reasoning", text: "Think" },
  1970. {
  1971. type: "tool",
  1972. id: "call-error",
  1973. name: "write",
  1974. state: {
  1975. status: "error",
  1976. input: { path: "README.md" },
  1977. error: { type: "tool.execution", message: "Denied" },
  1978. },
  1979. },
  1980. {
  1981. type: "tool",
  1982. id: "call-provider",
  1983. name: "web_search",
  1984. executed: true,
  1985. providerState: { source: "provider" },
  1986. providerResultState: { source: "provider" },
  1987. state: {
  1988. status: "completed",
  1989. input: { query: "hello" },
  1990. structured: {},
  1991. content: [
  1992. { type: "text", text: "Hello" },
  1993. { type: "file", mime: "image/png", uri: "data:image/png;base64,aGVsbG8=", name: "hello.png" },
  1994. ],
  1995. },
  1996. },
  1997. ],
  1998. },
  1999. ])
  2000. }),
  2001. )
  2002. it.effect("continues with reloaded history after durably settling one local tool call", () =>
  2003. Effect.gen(function* () {
  2004. const session = yield* setup
  2005. yield* admit(session, "Echo this")
  2006. responses = [reply.tool("call-echo", "echo", { text: "hello" }), reply.text("Done", "text-final")]
  2007. yield* session.resume(sessionID)
  2008. expect(requests).toHaveLength(2)
  2009. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "tool"])
  2010. expect(authorizations).toMatchObject([{ sessionID, toolCallID: "call-echo" }])
  2011. expect(executions).toEqual(["hello"])
  2012. const context = yield* session.context(sessionID)
  2013. expect(context).toMatchObject([
  2014. { type: "user", text: "Echo this" },
  2015. {
  2016. type: "assistant",
  2017. finish: "tool-calls",
  2018. content: [
  2019. {
  2020. type: "tool",
  2021. id: "call-echo",
  2022. name: "echo",
  2023. state: {
  2024. status: "completed",
  2025. input: { text: "hello" },
  2026. structured: { text: "hello" },
  2027. content: [{ type: "text", text: "hello" }],
  2028. },
  2029. },
  2030. ],
  2031. },
  2032. { type: "assistant", finish: "stop", content: [{ type: "text", text: "Done" }] },
  2033. ])
  2034. const assistant = requireAssistant(context)
  2035. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  2036. "session.step.started.1",
  2037. "session.tool.called.1",
  2038. "session.tool.success.1",
  2039. "session.step.ended.1",
  2040. ])
  2041. }),
  2042. )
  2043. it.effect("reloads a model switch before a tool-driven continuation step", () =>
  2044. Effect.gen(function* () {
  2045. const session = yield* setup
  2046. const events = yield* EventV2.Service
  2047. yield* admit(session, "Echo this")
  2048. responses = [reply.tool("call-echo", "echo", { text: "hello" }), reply.stop()]
  2049. toolExecutionGate = yield* Deferred.make<void>()
  2050. toolExecutionsStarted = yield* Deferred.make<void>()
  2051. toolExecutionsReady = 1
  2052. const run = yield* Effect.forkChild(session.resume(sessionID))
  2053. yield* Deferred.await(toolExecutionsStarted)
  2054. yield* events.publish(SessionEvent.ModelSelected, {
  2055. sessionID,
  2056. model: { id: ModelV2.ID.make("replacement"), providerID: ProviderV2.ID.make("fake") },
  2057. })
  2058. systemBaseline = "Replacement context"
  2059. yield* Deferred.succeed(toolExecutionGate, undefined)
  2060. yield* Fiber.join(run)
  2061. expect(requests.map((request) => request.model)).toEqual([model, replacementModel])
  2062. expect(requests.map((request) => request.system.map((part) => part.text))).toEqual([
  2063. [defaultSystem, "Initial context"],
  2064. [defaultSystem, "Initial context"],
  2065. ])
  2066. expect(systemTexts(requests[1]!)).toContain("Replacement context")
  2067. }),
  2068. )
  2069. it.effect("restores durable reasoning provider metadata in the next request", () =>
  2070. Effect.gen(function* () {
  2071. const session = yield* setup
  2072. yield* admit(session, "Think first")
  2073. response = [
  2074. LLMEvent.stepStart({ index: 0 }),
  2075. LLMEvent.reasoningStart({ id: "reasoning-anthropic" }),
  2076. LLMEvent.reasoningDelta({ id: "reasoning-anthropic", text: "Signed thought" }),
  2077. LLMEvent.reasoningEnd({
  2078. id: "reasoning-anthropic",
  2079. providerMetadata: { openai: { signature: "sig_1" }, anthropic: { ignored: true } },
  2080. }),
  2081. LLMEvent.reasoningStart({
  2082. id: "reasoning-openai",
  2083. providerMetadata: {
  2084. openai: { itemId: "rs_1", reasoningEncryptedContent: null },
  2085. anthropic: { ignored: true },
  2086. },
  2087. }),
  2088. LLMEvent.reasoningDelta({ id: "reasoning-openai", text: "Encrypted thought" }),
  2089. LLMEvent.reasoningEnd({
  2090. id: "reasoning-openai",
  2091. providerMetadata: {
  2092. openai: { itemId: "rs_1", reasoningEncryptedContent: "encrypted-state" },
  2093. anthropic: { ignored: true },
  2094. },
  2095. }),
  2096. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  2097. LLMEvent.finish({ reason: "stop" }),
  2098. ]
  2099. yield* session.resume(sessionID)
  2100. yield* replaySessionProjection(sessionID)
  2101. expect(yield* session.context(sessionID)).toMatchObject([
  2102. { type: "user", text: "Think first" },
  2103. {
  2104. type: "assistant",
  2105. content: [
  2106. {
  2107. type: "reasoning",
  2108. text: "Signed thought",
  2109. state: { signature: "sig_1" },
  2110. },
  2111. {
  2112. type: "reasoning",
  2113. text: "Encrypted thought",
  2114. state: { itemId: "rs_1", reasoningEncryptedContent: "encrypted-state" },
  2115. },
  2116. ],
  2117. },
  2118. ])
  2119. yield* admit(session, "Continue")
  2120. response = []
  2121. yield* session.resume(sessionID)
  2122. expect(requests[1]?.messages[1]?.content).toEqual([
  2123. {
  2124. type: "reasoning",
  2125. text: "Signed thought",
  2126. providerMetadata: { openai: { signature: "sig_1" } },
  2127. },
  2128. {
  2129. type: "reasoning",
  2130. text: "Encrypted thought",
  2131. providerMetadata: { openai: { itemId: "rs_1", reasoningEncryptedContent: "encrypted-state" } },
  2132. },
  2133. ])
  2134. }),
  2135. )
  2136. it.effect("replays durable provider-executed tool results inline in the next request", () =>
  2137. Effect.gen(function* () {
  2138. const session = yield* setup
  2139. yield* admit(session, "Search first")
  2140. response = [
  2141. LLMEvent.stepStart({ index: 0 }),
  2142. LLMEvent.toolCall({
  2143. id: "hosted-search",
  2144. name: "web_search",
  2145. input: { query: "Effect" },
  2146. providerExecuted: true,
  2147. providerMetadata: { openai: { itemId: "hosted-search" }, fake: { ignored: true } },
  2148. }),
  2149. LLMEvent.toolResult({
  2150. id: "hosted-search",
  2151. name: "web_search",
  2152. result: { type: "json", value: [{ title: "Effect" }] },
  2153. providerExecuted: true,
  2154. providerMetadata: { openai: { blockType: "web_search_tool_result" }, anthropic: { ignored: true } },
  2155. }),
  2156. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  2157. LLMEvent.finish({ reason: "stop" }),
  2158. ]
  2159. yield* session.resume(sessionID)
  2160. yield* replaySessionProjection(sessionID)
  2161. yield* admit(session, "Continue")
  2162. response = []
  2163. yield* session.resume(sessionID)
  2164. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "user"])
  2165. expect(requests[1]?.messages[1]?.content).toMatchObject([
  2166. {
  2167. type: "tool-call",
  2168. id: "hosted-search",
  2169. name: "web_search",
  2170. input: { query: "Effect" },
  2171. providerExecuted: true,
  2172. providerMetadata: { openai: { itemId: "hosted-search" } },
  2173. },
  2174. {
  2175. type: "tool-result",
  2176. id: "hosted-search",
  2177. name: "web_search",
  2178. result: { type: "json", value: [{ title: "Effect" }] },
  2179. providerExecuted: true,
  2180. providerMetadata: { openai: { blockType: "web_search_tool_result" } },
  2181. },
  2182. ])
  2183. }),
  2184. )
  2185. it.effect("starts recorded local tools eagerly and awaits settlement before continuing", () =>
  2186. Effect.gen(function* () {
  2187. const session = yield* setup
  2188. yield* admit(session, "Echo five times")
  2189. toolExecutionGate = yield* Deferred.make<void>()
  2190. toolExecutionsStarted = yield* Deferred.make<void>()
  2191. const providerGate = yield* Deferred.make<void>()
  2192. const initial = Stream.fromIterable([
  2193. LLMEvent.stepStart({ index: 0 }),
  2194. ...Array.from({ length: 5 }, (_, index) =>
  2195. LLMEvent.toolCall({ id: `call-echo-${index}`, name: "echo", input: { text: `${index}` } }),
  2196. ),
  2197. ])
  2198. const final = Stream.fromIterable([
  2199. LLMEvent.stepFinish({ index: 0, reason: "tool-calls" }),
  2200. LLMEvent.finish({ reason: "tool-calls" }),
  2201. ])
  2202. responseStream = Stream.concat(
  2203. initial,
  2204. Stream.fromEffect(Deferred.await(providerGate)).pipe(Stream.flatMap(() => final)),
  2205. )
  2206. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2207. yield* Deferred.await(toolExecutionsStarted)
  2208. expect(executions).toHaveLength(5)
  2209. expect(maxActiveToolExecutions).toBe(5)
  2210. expect(yield* session.context(sessionID)).toMatchObject([
  2211. { type: "user", text: "Echo five times" },
  2212. {
  2213. type: "assistant",
  2214. content: Array.from({ length: 5 }, (_, index) => ({
  2215. type: "tool",
  2216. id: `call-echo-${index}`,
  2217. state: { status: "running", input: { text: `${index}` } },
  2218. })),
  2219. },
  2220. ])
  2221. yield* Deferred.succeed(providerGate, undefined)
  2222. yield* Effect.yieldNow
  2223. expect(requests).toHaveLength(1)
  2224. yield* Deferred.succeed(toolExecutionGate, undefined)
  2225. yield* Fiber.join(run)
  2226. toolExecutionGate = undefined
  2227. toolExecutionsStarted = undefined
  2228. expect(executions).toHaveLength(5)
  2229. expect(maxActiveToolExecutions).toBe(5)
  2230. expect(requests).toHaveLength(2)
  2231. }),
  2232. )
  2233. it.effect("settles repeated provider-local tool call IDs against their owning assistant messages", () =>
  2234. Effect.gen(function* () {
  2235. const session = yield* setup
  2236. yield* admit(session, "Echo twice")
  2237. responses = [
  2238. reply.tool("tool_0", "echo", { text: "first" }),
  2239. reply.tool("tool_0", "echo", { text: "second" }),
  2240. [],
  2241. ]
  2242. yield* session.resume(sessionID)
  2243. expect(executions).toEqual(["first", "second"])
  2244. expect(requests).toHaveLength(3)
  2245. expect(yield* session.context(sessionID)).toMatchObject([
  2246. { type: "user", text: "Echo twice" },
  2247. {
  2248. type: "assistant",
  2249. content: [
  2250. {
  2251. type: "tool",
  2252. id: "tool_0",
  2253. state: { status: "completed", structured: { text: "first" }, content: [{ type: "text", text: "first" }] },
  2254. },
  2255. ],
  2256. },
  2257. {
  2258. type: "assistant",
  2259. content: [
  2260. {
  2261. type: "tool",
  2262. id: "tool_0",
  2263. state: {
  2264. status: "completed",
  2265. structured: { text: "second" },
  2266. content: [{ type: "text", text: "second" }],
  2267. },
  2268. },
  2269. ],
  2270. },
  2271. ])
  2272. yield* replaySessionProjection(sessionID)
  2273. expect(yield* session.context(sessionID)).toMatchObject([
  2274. { type: "user", text: "Echo twice" },
  2275. {
  2276. type: "assistant",
  2277. content: [
  2278. {
  2279. type: "tool",
  2280. id: "tool_0",
  2281. state: { status: "completed", structured: { text: "first" }, content: [{ type: "text", text: "first" }] },
  2282. },
  2283. ],
  2284. },
  2285. {
  2286. type: "assistant",
  2287. content: [
  2288. {
  2289. type: "tool",
  2290. id: "tool_0",
  2291. state: {
  2292. status: "completed",
  2293. structured: { text: "second" },
  2294. content: [{ type: "text", text: "second" }],
  2295. },
  2296. },
  2297. ],
  2298. },
  2299. ])
  2300. }),
  2301. )
  2302. it.effect("joins concurrent resume calls into one active provider run", () =>
  2303. Effect.gen(function* () {
  2304. const session = yield* setup
  2305. yield* admit(session, "Run once")
  2306. response = reply.text("Once", "text-once")
  2307. streamGate = yield* Deferred.make<void>()
  2308. streamStarted = yield* Deferred.make<void>()
  2309. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2310. yield* Deferred.await(streamStarted)
  2311. const second = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2312. yield* Effect.yieldNow
  2313. expect(requests).toHaveLength(1)
  2314. yield* Deferred.succeed(streamGate, undefined)
  2315. yield* Fiber.join(first)
  2316. yield* Fiber.join(second)
  2317. streamGate = undefined
  2318. streamStarted = undefined
  2319. expect(requests).toHaveLength(1)
  2320. expect(yield* session.context(sessionID)).toMatchObject([
  2321. { type: "user", text: "Run once" },
  2322. { type: "assistant", finish: "stop", content: [{ type: "text", text: "Once" }] },
  2323. ])
  2324. }),
  2325. )
  2326. it.effect("steers an active step with newly recorded prompts", () =>
  2327. Effect.gen(function* () {
  2328. const session = yield* setup
  2329. yield* admit(session, "Start working")
  2330. responses = [reply.stop(), reply.stop()]
  2331. streamGate = yield* Deferred.make<void>()
  2332. streamStarted = yield* Deferred.make<void>()
  2333. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2334. yield* Deferred.await(streamStarted)
  2335. yield* session.prompt({ sessionID, text: "Change direction" })
  2336. yield* Deferred.succeed(streamGate, undefined)
  2337. yield* Fiber.join(first)
  2338. streamGate = undefined
  2339. streamStarted = undefined
  2340. yield* Effect.yieldNow
  2341. expect(requests).toHaveLength(2)
  2342. expect(userTexts(requests[0]!)).toEqual(["Start working"])
  2343. expect(userTexts(requests[1]!)).toEqual(["Start working", "Change direction"])
  2344. expect((yield* session.context(sessionID)).map((message) => message.type)).toEqual([
  2345. "user",
  2346. "assistant",
  2347. "user",
  2348. "assistant",
  2349. ])
  2350. }),
  2351. )
  2352. it.effect("promotes queued input after continuation ends", () =>
  2353. Effect.gen(function* () {
  2354. const session = yield* setup
  2355. yield* admit(session, "Start working")
  2356. responses = [reply.tool("call-echo", "echo", { text: "hello" }), reply.stop(), reply.stop()]
  2357. streamGate = yield* Deferred.make<void>()
  2358. streamStarted = yield* Deferred.make<void>()
  2359. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2360. yield* Deferred.await(streamStarted)
  2361. yield* session.prompt({
  2362. sessionID,
  2363. text: "Wait until continuation ends",
  2364. delivery: "queue",
  2365. })
  2366. yield* Deferred.succeed(streamGate, undefined)
  2367. yield* Fiber.join(first)
  2368. streamGate = undefined
  2369. streamStarted = undefined
  2370. expect(requests).toHaveLength(3)
  2371. expect(userTexts(requests[0]!)).toEqual(["Start working"])
  2372. expect(userTexts(requests[1]!)).toEqual(["Start working"])
  2373. expect(userTexts(requests[2]!)).toEqual(["Start working", "Wait until continuation ends"])
  2374. }),
  2375. )
  2376. it.effect("preserves durable queued input for a later wake after interruption", () =>
  2377. Effect.gen(function* () {
  2378. const session = yield* setup
  2379. const { db } = yield* Database.Service
  2380. yield* admit(session, "Interrupt current work")
  2381. responses = [[], reply.stop()]
  2382. streamGate = yield* Deferred.make<void>()
  2383. streamStarted = yield* Deferred.make<void>()
  2384. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2385. yield* Deferred.await(streamStarted)
  2386. yield* session.prompt({
  2387. sessionID,
  2388. text: "Run after interrupt",
  2389. delivery: "queue",
  2390. })
  2391. yield* session.interrupt(sessionID)
  2392. expect(yield* Fiber.await(run)).toMatchObject({ _tag: "Failure" })
  2393. expect(requests).toHaveLength(1)
  2394. expect(yield* SessionPending.has(db, sessionID, "queue")).toBe(true)
  2395. const resumed = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2396. while (requests.length < 2) yield* Effect.yieldNow
  2397. yield* Deferred.succeed(streamGate, undefined)
  2398. yield* Fiber.join(resumed)
  2399. streamGate = undefined
  2400. streamStarted = undefined
  2401. expect(requests).toHaveLength(2)
  2402. expect(userTexts(requests[0]!)).toEqual(["Interrupt current work"])
  2403. expect(userTexts(requests[1]!)).toEqual(["Interrupt current work", "Run after interrupt"])
  2404. }),
  2405. )
  2406. it.effect("preserves durable steering input for a later resume after interruption", () =>
  2407. Effect.gen(function* () {
  2408. const session = yield* setup
  2409. const { db } = yield* Database.Service
  2410. yield* admit(session, "Interrupt current work")
  2411. responses = [[], reply.stop()]
  2412. streamGate = yield* Deferred.make<void>()
  2413. streamStarted = yield* Deferred.make<void>()
  2414. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2415. yield* Deferred.await(streamStarted)
  2416. yield* session.prompt({
  2417. sessionID,
  2418. text: "Steer after interrupt",
  2419. })
  2420. yield* session.interrupt(sessionID)
  2421. expect(yield* Fiber.await(run)).toMatchObject({ _tag: "Failure" })
  2422. expect(requests).toHaveLength(1)
  2423. expect(yield* SessionPending.has(db, sessionID, "steer")).toBe(true)
  2424. const resumed = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2425. while (requests.length < 2) yield* Effect.yieldNow
  2426. yield* Deferred.succeed(streamGate, undefined)
  2427. yield* Fiber.join(resumed)
  2428. streamGate = undefined
  2429. streamStarted = undefined
  2430. expect(requests).toHaveLength(2)
  2431. expect(userTexts(requests[0]!)).toEqual(["Interrupt current work"])
  2432. expect(userTexts(requests[1]!)).toEqual(["Interrupt current work", "Steer after interrupt"])
  2433. }),
  2434. )
  2435. it.effect("promotes queued inputs one at a time in FIFO order", () =>
  2436. Effect.gen(function* () {
  2437. const session = yield* setup
  2438. yield* admit(session, "Start working")
  2439. responses = [reply.stop(), reply.stop(), reply.stop()]
  2440. streamGate = yield* Deferred.make<void>()
  2441. streamStarted = yield* Deferred.make<void>()
  2442. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2443. yield* Deferred.await(streamStarted)
  2444. yield* session.prompt({ sessionID, text: "Queue first", delivery: "queue" })
  2445. yield* session.prompt({ sessionID, text: "Queue second", delivery: "queue" })
  2446. yield* Deferred.succeed(streamGate, undefined)
  2447. yield* Fiber.join(first)
  2448. streamGate = undefined
  2449. streamStarted = undefined
  2450. expect(requests).toHaveLength(3)
  2451. expect(userTexts(requests[0]!)).toEqual(["Start working"])
  2452. expect(userTexts(requests[1]!)).toEqual(["Start working", "Queue first"])
  2453. expect(userTexts(requests[2]!)).toEqual(["Start working", "Queue first", "Queue second"])
  2454. }),
  2455. )
  2456. it.effect("promotes queued input after steering continuation ends", () =>
  2457. Effect.gen(function* () {
  2458. const session = yield* setup
  2459. yield* admit(session, "Start steering")
  2460. yield* session.prompt({
  2461. sessionID,
  2462. text: "Queue for later",
  2463. delivery: "queue",
  2464. resume: false,
  2465. })
  2466. responses = [reply.stop(), reply.stop()]
  2467. yield* session.resume(sessionID)
  2468. expect(requests).toHaveLength(2)
  2469. expect(userTexts(requests[0]!)).toEqual(["Start steering"])
  2470. expect(userTexts(requests[1]!)).toEqual(["Start steering", "Queue for later"])
  2471. }),
  2472. )
  2473. it.effect("promotes steers before the next queued input", () =>
  2474. Effect.gen(function* () {
  2475. const session = yield* setup
  2476. yield* admit(session, "Start working")
  2477. responses = [reply.stop(), reply.stop(), reply.stop(), reply.stop()]
  2478. const firstGate = yield* Deferred.make<void>()
  2479. const secondGate = yield* Deferred.make<void>()
  2480. streamGate = firstGate
  2481. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2482. while (requests.length < 1) yield* Effect.yieldNow
  2483. yield* session.prompt({ sessionID, text: "Queue first", delivery: "queue" })
  2484. yield* session.prompt({ sessionID, text: "Queue second", delivery: "queue" })
  2485. streamGate = secondGate
  2486. yield* Deferred.succeed(firstGate, undefined)
  2487. while (requests.length < 2) yield* Effect.yieldNow
  2488. yield* session.prompt({ sessionID, text: "Steer before next queued input" })
  2489. yield* session.prompt({
  2490. sessionID,
  2491. text: "Also steer before next queued input",
  2492. })
  2493. yield* session.synthetic({ sessionID, text: "Background completion before next queued input" })
  2494. yield* Deferred.succeed(secondGate, undefined)
  2495. yield* Fiber.join(first)
  2496. streamGate = undefined
  2497. expect(requests).toHaveLength(4)
  2498. expect(userTexts(requests[0]!)).toEqual(["Start working"])
  2499. expect(userTexts(requests[1]!)).toEqual(["Start working", "Queue first"])
  2500. expect(userTexts(requests[2]!)).toEqual([
  2501. "Start working",
  2502. "Queue first",
  2503. "Steer before next queued input",
  2504. "Also steer before next queued input",
  2505. "Background completion before next queued input",
  2506. ])
  2507. expect(userTexts(requests[3]!)).toEqual([
  2508. "Start working",
  2509. "Queue first",
  2510. "Steer before next queued input",
  2511. "Also steer before next queued input",
  2512. "Background completion before next queued input",
  2513. "Queue second",
  2514. ])
  2515. }),
  2516. )
  2517. it.effect("coalesces multiple active steering prompts into one continuation step", () =>
  2518. Effect.gen(function* () {
  2519. const session = yield* setup
  2520. yield* admit(session, "Start working")
  2521. responses = [reply.stop(), reply.stop()]
  2522. streamGate = yield* Deferred.make<void>()
  2523. streamStarted = yield* Deferred.make<void>()
  2524. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2525. yield* Deferred.await(streamStarted)
  2526. yield* session.prompt({ sessionID, text: "First steer" })
  2527. yield* session.prompt({ sessionID, text: "Second steer" })
  2528. yield* Deferred.succeed(streamGate, undefined)
  2529. yield* Fiber.join(first)
  2530. streamGate = undefined
  2531. streamStarted = undefined
  2532. yield* Effect.yieldNow
  2533. expect(requests).toHaveLength(2)
  2534. expect(userTexts(requests[1]!)).toEqual(["Start working", "First steer", "Second steer"])
  2535. yield* (yield* SessionExecution.Service).wake(sessionID)
  2536. yield* Effect.yieldNow
  2537. expect(requests).toHaveLength(2)
  2538. }),
  2539. )
  2540. it.effect("runs steering input accepted while the active step fails", () =>
  2541. Effect.gen(function* () {
  2542. const session = yield* setup
  2543. yield* admit(session, "Start working")
  2544. streamFailure = invalidRequest()
  2545. streamGate = yield* Deferred.make<void>()
  2546. streamStarted = yield* Deferred.make<void>()
  2547. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2548. yield* Deferred.await(streamStarted)
  2549. yield* session.prompt({ sessionID, text: "Recover with this" })
  2550. yield* Deferred.succeed(streamGate, undefined)
  2551. expect(yield* Fiber.join(first).pipe(Effect.flip)).toBe(streamFailure)
  2552. streamFailure = undefined
  2553. streamGate = undefined
  2554. streamStarted = undefined
  2555. yield* Effect.yieldNow
  2556. expect(requests).toHaveLength(2)
  2557. expect(userTexts(requests[1]!)).toEqual(["Start working", "Recover with this"])
  2558. }),
  2559. )
  2560. it.effect("durably fails local tools left running by a prior process before continuing", () =>
  2561. Effect.gen(function* () {
  2562. const session = yield* setup
  2563. const events = yield* EventV2.Service
  2564. yield* admit(session, "Recover interrupted tool")
  2565. yield* SessionPending.promoteSteers((yield* Database.Service).db, events, sessionID)
  2566. const assistantMessageID = SessionMessage.ID.create()
  2567. yield* events.publish(SessionEvent.Step.Started, {
  2568. sessionID,
  2569. assistantMessageID,
  2570. agent: AgentV2.ID.make("build"),
  2571. model: { id: ModelV2.ID.make("fake-model"), providerID: ProviderV2.ID.make("fake") },
  2572. })
  2573. yield* events.publish(SessionEvent.Tool.Input.Started, {
  2574. sessionID,
  2575. assistantMessageID,
  2576. callID: "call-interrupted",
  2577. name: "echo",
  2578. })
  2579. yield* events.publish(SessionEvent.Tool.Input.Ended, {
  2580. sessionID,
  2581. assistantMessageID,
  2582. callID: "call-interrupted",
  2583. text: '{"text":"stale"}',
  2584. })
  2585. yield* events.publish(SessionEvent.Tool.Called, {
  2586. sessionID,
  2587. assistantMessageID,
  2588. callID: "call-interrupted",
  2589. input: { text: "stale" },
  2590. executed: false,
  2591. })
  2592. requests.length = 0
  2593. response = []
  2594. yield* session.resume(sessionID)
  2595. expect(requests).toHaveLength(1)
  2596. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "tool"])
  2597. expect(yield* session.context(sessionID)).toMatchObject([
  2598. { type: "user", text: "Recover interrupted tool" },
  2599. {
  2600. type: "assistant",
  2601. content: [
  2602. {
  2603. type: "tool",
  2604. id: "call-interrupted",
  2605. state: {
  2606. status: "error",
  2607. error: { type: "aborted", message: "Tool execution interrupted: echo" },
  2608. },
  2609. },
  2610. ],
  2611. },
  2612. ])
  2613. }),
  2614. )
  2615. it.effect("durably fails hosted tools left running by a prior process before continuing inline", () =>
  2616. Effect.gen(function* () {
  2617. const session = yield* setup
  2618. const events = yield* EventV2.Service
  2619. yield* admit(session, "Recover interrupted hosted tool")
  2620. yield* SessionPending.promoteSteers((yield* Database.Service).db, events, sessionID)
  2621. const assistantMessageID = SessionMessage.ID.create()
  2622. yield* events.publish(SessionEvent.Step.Started, {
  2623. sessionID,
  2624. assistantMessageID,
  2625. agent: AgentV2.ID.make("build"),
  2626. model: { id: ModelV2.ID.make("fake-model"), providerID: ProviderV2.ID.make("fake") },
  2627. })
  2628. yield* events.publish(SessionEvent.Tool.Input.Started, {
  2629. sessionID,
  2630. assistantMessageID,
  2631. callID: "call-hosted-interrupted",
  2632. name: "web_search",
  2633. })
  2634. yield* events.publish(SessionEvent.Tool.Input.Ended, {
  2635. sessionID,
  2636. assistantMessageID,
  2637. callID: "call-hosted-interrupted",
  2638. text: '{"query":"stale"}',
  2639. })
  2640. yield* events.publish(SessionEvent.Tool.Called, {
  2641. sessionID,
  2642. assistantMessageID,
  2643. callID: "call-hosted-interrupted",
  2644. input: { query: "stale" },
  2645. executed: true,
  2646. state: { itemId: "call-hosted-interrupted" },
  2647. })
  2648. requests.length = 0
  2649. response = []
  2650. yield* session.resume(sessionID)
  2651. expect(requests).toHaveLength(1)
  2652. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user", "assistant"])
  2653. expect(requests[0]?.messages[1]?.content).toMatchObject([
  2654. {
  2655. type: "tool-call",
  2656. id: "call-hosted-interrupted",
  2657. providerExecuted: true,
  2658. providerMetadata: { openai: { itemId: "call-hosted-interrupted" } },
  2659. },
  2660. { type: "tool-result", id: "call-hosted-interrupted", providerExecuted: true, result: { type: "error" } },
  2661. ])
  2662. }),
  2663. )
  2664. it.effect("durably fails pending tool input left by a prior process before continuing", () =>
  2665. Effect.gen(function* () {
  2666. const session = yield* setup
  2667. const events = yield* EventV2.Service
  2668. yield* admit(session, "Recover interrupted tool input")
  2669. yield* SessionPending.promoteSteers((yield* Database.Service).db, events, sessionID)
  2670. const assistantMessageID = SessionMessage.ID.create()
  2671. yield* events.publish(SessionEvent.Step.Started, {
  2672. sessionID,
  2673. assistantMessageID,
  2674. agent: AgentV2.ID.make("build"),
  2675. model: { id: ModelV2.ID.make("fake-model"), providerID: ProviderV2.ID.make("fake") },
  2676. })
  2677. yield* events.publish(SessionEvent.Tool.Input.Started, {
  2678. sessionID,
  2679. assistantMessageID,
  2680. callID: "call-pending-interrupted",
  2681. name: "echo",
  2682. })
  2683. requests.length = 0
  2684. response = []
  2685. yield* session.resume(sessionID)
  2686. expect(requests).toHaveLength(1)
  2687. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "tool"])
  2688. expect(yield* session.context(sessionID)).toMatchObject([
  2689. { type: "user", text: "Recover interrupted tool input" },
  2690. { type: "assistant", content: [{ type: "tool", id: "call-pending-interrupted", state: { status: "error" } }] },
  2691. ])
  2692. }),
  2693. )
  2694. it.effect("promotes the first queued input when woken while idle", () =>
  2695. Effect.gen(function* () {
  2696. const session = yield* setup
  2697. yield* session.prompt({
  2698. sessionID,
  2699. text: "Wait in queue",
  2700. delivery: "queue",
  2701. resume: false,
  2702. })
  2703. yield* (yield* SessionExecution.Service).wake(sessionID)
  2704. while (requests.length === 0) yield* Effect.yieldNow
  2705. expect(requests).toHaveLength(1)
  2706. expect(userTexts(requests[0]!)).toEqual(["Wait in queue"])
  2707. }),
  2708. )
  2709. it.effect("retries inbox input after prompt projection rolls back", () =>
  2710. Effect.gen(function* () {
  2711. const session = yield* setup
  2712. const events = yield* EventV2.Service
  2713. const defect = new Error("fail after prompt promotion")
  2714. let fail = true
  2715. yield* events.project(SessionEvent.InputPromoted, () => (fail ? Effect.die(defect) : Effect.void))
  2716. yield* admit(session, "Recover promoted input")
  2717. expect(yield* session.resume(sessionID).pipe(Effect.catchDefect(Effect.succeed))).toBe(defect)
  2718. fail = false
  2719. requests.length = 0
  2720. response = reply.stop()
  2721. yield* (yield* SessionExecution.Service).wake(sessionID)
  2722. while (requests.length === 0) yield* Effect.yieldNow
  2723. expect(userTexts(requests[0]!)).toEqual(["Recover promoted input"])
  2724. }),
  2725. )
  2726. it.effect("does not strand a committed promotion when a post-commit listener defects", () =>
  2727. Effect.gen(function* () {
  2728. const session = yield* setup
  2729. const events = yield* EventV2.Service
  2730. yield* events.listen((event) =>
  2731. event.type === SessionEvent.InputPromoted.type
  2732. ? Effect.die("fail after prompt promotion commits")
  2733. : Effect.void,
  2734. )
  2735. yield* admit(session, "Run committed promotion")
  2736. yield* session.resume(sessionID)
  2737. expect(requests).toHaveLength(1)
  2738. expect(userTexts(requests[0]!)).toEqual(["Run committed promotion"])
  2739. }),
  2740. )
  2741. it.effect("runs different sessions concurrently", () =>
  2742. Effect.gen(function* () {
  2743. const session = yield* setup
  2744. yield* insertSession(otherSessionID)
  2745. yield* admit(session, "Run first")
  2746. yield* session.prompt({
  2747. sessionID: otherSessionID,
  2748. text: "Run second",
  2749. resume: false,
  2750. })
  2751. streamGate = yield* Deferred.make<void>()
  2752. streamStarted = yield* Deferred.make<void>()
  2753. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2754. yield* Deferred.await(streamStarted)
  2755. streamStarted = yield* Deferred.make<void>()
  2756. const second = yield* session.resume(otherSessionID).pipe(Effect.forkChild)
  2757. yield* Deferred.await(streamStarted)
  2758. expect(requests).toHaveLength(2)
  2759. expect(requests.map((request) => request.providerOptions?.openai?.promptCacheKey)).toEqual([
  2760. sessionID,
  2761. otherSessionID,
  2762. ])
  2763. yield* Deferred.succeed(streamGate, undefined)
  2764. yield* Fiber.join(first)
  2765. yield* Fiber.join(second)
  2766. streamGate = undefined
  2767. streamStarted = undefined
  2768. }),
  2769. )
  2770. it.effect("bounds 64-character session prompt cache keys", () =>
  2771. Effect.gen(function* () {
  2772. const session = yield* setup
  2773. const longSessionID = SessionV2.ID.make(`ses_${"a".repeat(64)}`)
  2774. const otherLongSessionID = SessionV2.ID.make(`ses_${"b".repeat(64)}`)
  2775. yield* insertSession(longSessionID)
  2776. yield* insertSession(otherLongSessionID)
  2777. yield* session.prompt({
  2778. sessionID: longSessionID,
  2779. text: "Run long session",
  2780. resume: false,
  2781. })
  2782. yield* session.prompt({
  2783. sessionID: otherLongSessionID,
  2784. text: "Run other long session",
  2785. resume: false,
  2786. })
  2787. yield* session.resume(longSessionID)
  2788. yield* session.resume(otherLongSessionID)
  2789. const keys = requests.map((request) => request.providerOptions?.openai?.promptCacheKey)
  2790. expect(keys).toEqual([longSessionID.slice(4), otherLongSessionID.slice(4)])
  2791. expect(keys.every((key) => typeof key === "string" && key.length === 64)).toBe(true)
  2792. expect(keys[0]).not.toBe(keys[1])
  2793. }),
  2794. )
  2795. it.effect("fans out one failed run and allows a later retry", () =>
  2796. Effect.gen(function* () {
  2797. const session = yield* setup
  2798. yield* admit(session, "Retry after failure")
  2799. streamFailure = invalidRequest()
  2800. streamGate = yield* Deferred.make<void>()
  2801. streamStarted = yield* Deferred.make<void>()
  2802. const first = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2803. yield* Deferred.await(streamStarted)
  2804. const second = yield* session.resume(sessionID).pipe(Effect.forkChild)
  2805. yield* Effect.yieldNow
  2806. expect(requests).toHaveLength(1)
  2807. yield* Deferred.succeed(streamGate, undefined)
  2808. const [firstExit, secondExit] = yield* Effect.all([Fiber.await(first), Fiber.await(second)])
  2809. expect(secondExit).toEqual(firstExit)
  2810. streamFailure = undefined
  2811. streamGate = undefined
  2812. streamStarted = undefined
  2813. yield* session.resume(sessionID)
  2814. expect(requests).toHaveLength(2)
  2815. }),
  2816. )
  2817. it.effect("durably settles local tool failures before continuing", () =>
  2818. Effect.gen(function* () {
  2819. const session = yield* setup
  2820. yield* admit(session, "Call missing")
  2821. responses = [reply.tool("call-missing", "missing", {}), reply.text("Recovered", "text-after-error")]
  2822. yield* session.resume(sessionID)
  2823. expect(requests).toHaveLength(2)
  2824. expect(yield* session.context(sessionID)).toMatchObject([
  2825. { type: "user", text: "Call missing" },
  2826. {
  2827. type: "assistant",
  2828. content: [
  2829. {
  2830. type: "tool",
  2831. id: "call-missing",
  2832. state: {
  2833. status: "error",
  2834. error: { type: "tool.unknown", message: "Unknown tool: missing" },
  2835. },
  2836. },
  2837. ],
  2838. },
  2839. { type: "assistant", finish: "stop", content: [{ type: "text", text: "Recovered" }] },
  2840. ])
  2841. }),
  2842. )
  2843. it.effect("returns unexpected local tool defects to the model and continues", () =>
  2844. Effect.gen(function* () {
  2845. const session = yield* setup
  2846. yield* admit(session, "Call defect")
  2847. responses = [reply.tool("call-defect", "defect", {}), reply.text("Recovered", "text-after-defect")]
  2848. yield* session.resume(sessionID)
  2849. expect(requests).toHaveLength(2)
  2850. expect(requests[1]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "tool"])
  2851. const context = yield* session.context(sessionID)
  2852. expect(context).toMatchObject([
  2853. { type: "user", text: "Call defect" },
  2854. {
  2855. type: "assistant",
  2856. content: [
  2857. {
  2858. type: "tool",
  2859. id: "call-defect",
  2860. state: {
  2861. status: "error",
  2862. error: { type: "unknown", message: "unexpected tool defect" },
  2863. },
  2864. },
  2865. ],
  2866. },
  2867. { type: "assistant", finish: "stop", content: [{ type: "text", text: "Recovered" }] },
  2868. ])
  2869. const assistant = requireAssistant(context)
  2870. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  2871. "session.step.started.1",
  2872. "session.tool.called.1",
  2873. "session.tool.failed.1",
  2874. "session.step.ended.1",
  2875. ])
  2876. }),
  2877. )
  2878. it.effect("returns tool-wrapped policy blocks to the model and continues", () =>
  2879. Effect.gen(function* () {
  2880. const session = yield* setup
  2881. const registry = yield* ToolRegistry.Service
  2882. yield* registry.register({
  2883. blocked: Tool.make({
  2884. description: "Fail because policy blocked execution",
  2885. input: Schema.Struct({}),
  2886. output: Schema.Struct({}),
  2887. execute: () =>
  2888. Effect.fail(new PermissionV2.BlockedError({ rules: [], permission: "blocked", resources: ["*"] })).pipe(
  2889. Effect.mapError(() => new Tool.Failure({ message: "Permission blocked" })),
  2890. ),
  2891. }),
  2892. })
  2893. yield* admit(session, "Call blocked")
  2894. responses = [reply.tool("call-blocked", "blocked", {}), reply.stop()]
  2895. yield* session.resume(sessionID)
  2896. expect(requests).toHaveLength(2)
  2897. expect(yield* session.context(sessionID)).toMatchObject([
  2898. { type: "user", text: "Call blocked" },
  2899. {
  2900. type: "assistant",
  2901. content: [
  2902. { type: "tool", id: "call-blocked", state: { status: "error", error: { message: "Permission blocked" } } },
  2903. ],
  2904. },
  2905. { type: "assistant", finish: "stop" },
  2906. ])
  2907. }),
  2908. )
  2909. it.effect("interrupts runner continuation when permission approval is declined", () =>
  2910. Effect.gen(function* () {
  2911. const session = yield* setup
  2912. const registry = yield* ToolRegistry.Service
  2913. yield* registry.register({
  2914. declined: Tool.make({
  2915. description: "Fail because the user declined approval",
  2916. input: Schema.Struct({}),
  2917. output: Schema.Struct({}),
  2918. execute: () => Effect.die(new PermissionV2.DeclinedError()),
  2919. }),
  2920. })
  2921. yield* admit(session, "Call declined")
  2922. response = reply.tool("call-declined", "declined", {})
  2923. const exit = yield* session.resume(sessionID).pipe(Effect.exit)
  2924. expect(exit._tag).toBe("Failure")
  2925. if (exit._tag === "Failure") expect(Cause.hasInterruptsOnly(exit.cause)).toBe(true)
  2926. expect(requests).toHaveLength(1)
  2927. expect(yield* session.context(sessionID)).toMatchObject([
  2928. { type: "user", text: "Call declined" },
  2929. {
  2930. type: "assistant",
  2931. content: [
  2932. {
  2933. type: "tool",
  2934. id: "call-declined",
  2935. state: { status: "error", error: { message: "Tool execution interrupted" } },
  2936. },
  2937. ],
  2938. },
  2939. ])
  2940. }),
  2941. )
  2942. it.effect("returns permission corrections to the model and continues", () =>
  2943. Effect.gen(function* () {
  2944. const session = yield* setup
  2945. const registry = yield* ToolRegistry.Service
  2946. yield* registry.register({
  2947. corrected: Tool.make({
  2948. description: "Fail with user correction feedback",
  2949. input: Schema.Struct({}),
  2950. output: Schema.Struct({}),
  2951. execute: () =>
  2952. Effect.fail(new PermissionV2.CorrectedError({ feedback: "Use another tool" })).pipe(
  2953. Effect.mapError(() => new Tool.Failure({ message: "Use another tool" })),
  2954. ),
  2955. }),
  2956. })
  2957. yield* admit(session, "Call corrected")
  2958. responses = [reply.tool("call-corrected", "corrected", {}), reply.stop()]
  2959. yield* session.resume(sessionID)
  2960. expect(requests).toHaveLength(2)
  2961. expect(yield* session.context(sessionID)).toMatchObject([
  2962. { type: "user", text: "Call corrected" },
  2963. {
  2964. type: "assistant",
  2965. content: [
  2966. { type: "tool", id: "call-corrected", state: { status: "error", error: { message: "Use another tool" } } },
  2967. ],
  2968. },
  2969. { type: "assistant", finish: "stop" },
  2970. ])
  2971. }),
  2972. )
  2973. it.effect("fails the drain when tool output persistence fails", () =>
  2974. Effect.gen(function* () {
  2975. const session = yield* setup
  2976. yield* admit(session, "Call storefail")
  2977. responses = [reply.tool("call-storefail", "storefail", {}), []]
  2978. const exit = yield* session.resume(sessionID).pipe(Effect.exit)
  2979. expect(Exit.isFailure(exit)).toBe(true)
  2980. expect(requests).toHaveLength(1)
  2981. expect(yield* session.context(sessionID)).toMatchObject([
  2982. { type: "user", text: "Call storefail" },
  2983. {
  2984. type: "assistant",
  2985. content: [
  2986. {
  2987. type: "tool",
  2988. id: "call-storefail",
  2989. state: {
  2990. status: "error",
  2991. error: {
  2992. type: "unknown",
  2993. message: expect.stringContaining("Failed to encode tool output"),
  2994. },
  2995. },
  2996. },
  2997. ],
  2998. finish: "error",
  2999. error: { type: "unknown", message: expect.stringContaining("Failed to encode tool output") },
  3000. },
  3001. ])
  3002. }),
  3003. )
  3004. it.effect("returns configured permission denials to the model and continues", () =>
  3005. Effect.gen(function* () {
  3006. const session = yield* setup
  3007. const registry = yield* ToolRegistry.Service
  3008. yield* registry.register({ permissionfail: permissionFail })
  3009. yield* admit(session, "Reject permission")
  3010. responses = [
  3011. reply.tool("call-permission", "permissionfail", {}),
  3012. [LLMEvent.stepStart({ index: 0 }), LLMEvent.stepFinish({ index: 0, reason: "stop" })],
  3013. ]
  3014. yield* session.resume(sessionID)
  3015. expect(requests).toHaveLength(2)
  3016. expect(yield* session.context(sessionID)).toMatchObject([
  3017. { type: "user" },
  3018. {
  3019. type: "assistant",
  3020. content: [
  3021. {
  3022. type: "tool",
  3023. id: "call-permission",
  3024. state: {
  3025. status: "error",
  3026. error: {
  3027. type: "permission.rejected",
  3028. message: "Permission denied: edit",
  3029. },
  3030. },
  3031. },
  3032. ],
  3033. },
  3034. { type: "assistant", finish: "stop" },
  3035. ])
  3036. expect(yield* recordedEventTypes(sessionID)).not.toContain("session.step.failed.1")
  3037. }),
  3038. )
  3039. it.effect("interrupts runner continuation when a question is cancelled", () =>
  3040. Effect.gen(function* () {
  3041. const session = yield* setup
  3042. const registry = yield* ToolRegistry.Service
  3043. yield* registry.register({
  3044. question: Tool.make({
  3045. description: "Ask the user",
  3046. input: Schema.Struct({}),
  3047. output: Schema.Struct({}),
  3048. execute: () => Effect.die(new QuestionTool.CancelledError()),
  3049. }),
  3050. })
  3051. yield* admit(session, "Ask then stop")
  3052. responses = [reply.tool("call-question", "question", {}), []]
  3053. const run = yield* session.resume(sessionID).pipe(Effect.exit, Effect.forkChild)
  3054. const exit = yield* Fiber.join(run)
  3055. expect(exit._tag).toBe("Failure")
  3056. if (exit._tag === "Failure") expect(Cause.hasInterruptsOnly(exit.cause)).toBe(true)
  3057. expect(requests).toHaveLength(1)
  3058. expect(yield* session.context(sessionID)).toMatchObject([
  3059. { type: "user", text: "Ask then stop" },
  3060. {
  3061. type: "assistant",
  3062. content: [
  3063. {
  3064. type: "tool",
  3065. id: "call-question",
  3066. state: { status: "error", error: { type: "aborted", message: "Tool execution interrupted" } },
  3067. },
  3068. ],
  3069. },
  3070. ])
  3071. }),
  3072. )
  3073. it.effect("awaits started local tools before surfacing provider stream failure", () =>
  3074. Effect.gen(function* () {
  3075. const session = yield* setup
  3076. yield* admit(session, "Settle before failing")
  3077. const failure = providerUnavailable()
  3078. toolExecutionGate = yield* Deferred.make<void>()
  3079. responseStream = Stream.concat(
  3080. Stream.fromIterable([
  3081. LLMEvent.stepStart({ index: 0 }),
  3082. LLMEvent.toolCall({ id: "call-before-failure", name: "echo", input: { text: "settle" } }),
  3083. ]),
  3084. Stream.fail(failure),
  3085. )
  3086. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3087. while (executions.length === 0) yield* Effect.yieldNow
  3088. yield* Effect.yieldNow
  3089. yield* Deferred.succeed(toolExecutionGate, undefined)
  3090. expect(yield* Fiber.join(run).pipe(Effect.flip)).toBe(failure)
  3091. toolExecutionGate = undefined
  3092. const context = yield* session.context(sessionID)
  3093. expect(context).toMatchObject([
  3094. { type: "user", text: "Settle before failing" },
  3095. {
  3096. type: "assistant",
  3097. content: [
  3098. { type: "tool", id: "call-before-failure", state: { status: "completed", structured: { text: "settle" } } },
  3099. ],
  3100. },
  3101. ])
  3102. const assistant = requireAssistant(context)
  3103. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  3104. "session.step.started.1",
  3105. "session.tool.called.1",
  3106. "session.tool.success.1",
  3107. "session.step.failed.1",
  3108. ])
  3109. }),
  3110. )
  3111. it.effect("durably fails blocked local tools when a step is interrupted", () =>
  3112. Effect.gen(function* () {
  3113. const session = yield* setup
  3114. yield* admit(session, "Interrupt blocked tool")
  3115. toolExecutionGate = yield* Deferred.make<void>()
  3116. responseStream = Stream.concat(
  3117. Stream.fromIterable([
  3118. LLMEvent.stepStart({ index: 0 }),
  3119. LLMEvent.toolCall({ id: "call-before-interrupt", name: "echo", input: { text: "blocked" } }),
  3120. ]),
  3121. Stream.never,
  3122. )
  3123. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3124. while (executions.length === 0) yield* Effect.yieldNow
  3125. yield* session.interrupt(sessionID)
  3126. toolExecutionGate = undefined
  3127. expect(yield* Fiber.await(run)).toMatchObject({ _tag: "Failure" })
  3128. yield* session.interrupt(sessionID)
  3129. const context = yield* session.context(sessionID)
  3130. expect(context).toMatchObject([
  3131. { type: "user", text: "Interrupt blocked tool" },
  3132. {
  3133. type: "assistant",
  3134. content: [
  3135. {
  3136. type: "tool",
  3137. id: "call-before-interrupt",
  3138. state: { status: "error", error: { type: "aborted", message: "Tool execution interrupted" } },
  3139. },
  3140. ],
  3141. },
  3142. ])
  3143. const assistant = requireAssistant(context)
  3144. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  3145. "session.step.started.1",
  3146. "session.tool.called.1",
  3147. "session.tool.failed.1",
  3148. "session.step.failed.1",
  3149. ])
  3150. yield* replaySessionProjection(sessionID)
  3151. expect(yield* session.context(sessionID)).toMatchObject([
  3152. { type: "user", text: "Interrupt blocked tool" },
  3153. { type: "assistant", content: [{ type: "tool", id: "call-before-interrupt", state: { status: "error" } }] },
  3154. ])
  3155. requests.length = 0
  3156. responseStream = undefined
  3157. response = []
  3158. yield* session.resume(sessionID)
  3159. expect(requests[0]?.messages.map((message) => message.role)).toEqual(["user", "assistant", "tool"])
  3160. }),
  3161. )
  3162. it.effect("interrupts a blocked step without local tool execution", () =>
  3163. Effect.gen(function* () {
  3164. const session = yield* setup
  3165. yield* admit(session, "Interrupt provider")
  3166. streamGate = yield* Deferred.make<void>()
  3167. streamStarted = yield* Deferred.make<void>()
  3168. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3169. yield* Deferred.await(streamStarted)
  3170. yield* session.interrupt(sessionID)
  3171. const exit = yield* Fiber.await(run)
  3172. streamGate = undefined
  3173. streamStarted = undefined
  3174. expect(Exit.isFailure(exit) && Cause.hasInterruptsOnly(exit.cause)).toBeTrue()
  3175. expect(requests).toHaveLength(1)
  3176. expect(yield* session.context(sessionID)).toMatchObject([
  3177. { type: "user", text: "Interrupt provider" },
  3178. { type: "assistant", finish: "error", error: { type: "aborted", message: "Step interrupted" } },
  3179. ])
  3180. expect(yield* recordedEventTypes(sessionID)).toContain("session.step.failed.1")
  3181. yield* session.interrupt(sessionID)
  3182. }),
  3183. )
  3184. it.effect("durably fails blocked local tools when interrupted while awaiting settlement", () =>
  3185. Effect.gen(function* () {
  3186. const session = yield* setup
  3187. yield* admit(session, "Interrupt tool settlement")
  3188. toolExecutionGate = yield* Deferred.make<void>()
  3189. toolExecutionsStarted = yield* Deferred.make<void>()
  3190. toolExecutionsReady = 1
  3191. response = reply.tool("call-await-interrupt", "echo", { text: "blocked" })
  3192. const runner = yield* SessionRunner.Service
  3193. const run = yield* runner.drain({ sessionID, force: true }).pipe(Effect.forkChild)
  3194. yield* Deferred.await(toolExecutionsStarted)
  3195. yield* Fiber.interrupt(run)
  3196. toolExecutionGate = undefined
  3197. expect(yield* Fiber.await(run)).toMatchObject({ _tag: "Failure" })
  3198. expect(yield* session.context(sessionID)).toMatchObject([
  3199. { type: "user", text: "Interrupt tool settlement" },
  3200. {
  3201. type: "assistant",
  3202. finish: "error",
  3203. error: { type: "aborted", message: "Step interrupted" },
  3204. content: [
  3205. {
  3206. type: "tool",
  3207. id: "call-await-interrupt",
  3208. state: { status: "error", error: { type: "aborted", message: "Tool execution interrupted" } },
  3209. },
  3210. ],
  3211. },
  3212. ])
  3213. const eventTypes = yield* recordedEventTypes(sessionID)
  3214. expect(eventTypes).toContain("session.step.failed.1")
  3215. expect(eventTypes).not.toContain("session.step.ended.1")
  3216. }),
  3217. )
  3218. it.effect("forces a text response on an agent's configured final step", () =>
  3219. Effect.gen(function* () {
  3220. const session = yield* setup
  3221. const agents = yield* AgentV2.Service
  3222. yield* agents.transform((editor) =>
  3223. editor.update(AgentV2.ID.make("build"), (agent) => {
  3224. agent.steps = 2
  3225. }),
  3226. )
  3227. yield* admit(session, "Finish at the limit")
  3228. responses = [
  3229. reply.tool("call-terminal", "echo", { text: "done" }),
  3230. reply.tool("call-forbidden", "echo", { text: "forbidden" }),
  3231. ]
  3232. yield* session.resume(sessionID)
  3233. expect(requests).toHaveLength(2)
  3234. expect(requests[0]?.toolChoice).toBeUndefined()
  3235. expect(requests[1]?.toolChoice).toMatchObject({ type: "none" })
  3236. expect(requests[1]?.tools).toEqual([])
  3237. expect(requests[1]?.messages.at(-1)).toMatchObject({
  3238. role: "assistant",
  3239. content: [{ type: "text", text: expect.stringContaining("MAXIMUM STEPS REACHED") }],
  3240. })
  3241. expect(executions).toEqual(["done"])
  3242. expect(yield* session.context(sessionID)).toMatchObject([
  3243. { type: "user", text: "Finish at the limit" },
  3244. { type: "assistant", content: [{ type: "tool", id: "call-terminal", state: { status: "completed" } }] },
  3245. { type: "assistant", content: [{ type: "tool", id: "call-forbidden", state: { status: "error" } }] },
  3246. ])
  3247. }),
  3248. )
  3249. it.effect("resets the configured step allowance when steering input promotes", () =>
  3250. Effect.gen(function* () {
  3251. const session = yield* setup
  3252. const agents = yield* AgentV2.Service
  3253. yield* agents.transform((editor) =>
  3254. editor.update(AgentV2.ID.make("build"), (agent) => {
  3255. agent.steps = 2
  3256. }),
  3257. )
  3258. yield* admit(session, "Start work")
  3259. responses = [
  3260. reply.tool("call-before-steer", "echo", { text: "before" }),
  3261. reply.tool("call-after-steer", "echo", { text: "after" }),
  3262. reply.stop(),
  3263. ]
  3264. streamGate = yield* Deferred.make<void>()
  3265. streamStarted = yield* Deferred.make<void>()
  3266. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3267. yield* Deferred.await(streamStarted)
  3268. yield* session.prompt({ sessionID, text: "Change direction" })
  3269. yield* Deferred.succeed(streamGate, undefined)
  3270. yield* Fiber.join(run)
  3271. streamGate = undefined
  3272. streamStarted = undefined
  3273. expect(requests).toHaveLength(3)
  3274. expect(requests[1]?.toolChoice).toBeUndefined()
  3275. expect(requests[1]?.tools).not.toEqual([])
  3276. expect(requests[2]?.toolChoice).toMatchObject({ type: "none" })
  3277. expect(executions).toEqual(["before", "after"])
  3278. }),
  3279. )
  3280. it.effect("projects provider errors as terminal assistant step failures", () =>
  3281. Effect.gen(function* () {
  3282. const session = yield* setup
  3283. yield* admit(session, "Fail durably")
  3284. response = [LLMEvent.stepStart({ index: 0 }), LLMEvent.providerError({ message: "Provider unavailable" })]
  3285. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider unavailable")
  3286. expect(requests).toHaveLength(1)
  3287. expect(yield* session.context(sessionID)).toMatchObject([
  3288. { type: "user", text: "Fail durably" },
  3289. { type: "assistant", finish: "error", error: { type: "provider.unknown", message: "Provider unavailable" } },
  3290. ])
  3291. }),
  3292. )
  3293. it.effect("projects provider errors emitted before assistant step start", () =>
  3294. Effect.gen(function* () {
  3295. const session = yield* setup
  3296. yield* admit(session, "Fail before step")
  3297. response = [LLMEvent.providerError({ message: "Provider unavailable" })]
  3298. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider unavailable")
  3299. expect(requests).toHaveLength(1)
  3300. expect(yield* session.context(sessionID)).toMatchObject([
  3301. { type: "user", text: "Fail before step" },
  3302. { type: "assistant", finish: "error", error: { type: "provider.unknown", message: "Provider unavailable" } },
  3303. ])
  3304. }),
  3305. )
  3306. it.effect("projects content-filter finishes as visible terminal failures", () =>
  3307. Effect.gen(function* () {
  3308. const session = yield* setup
  3309. yield* admit(session, "Blocked response")
  3310. response = [
  3311. LLMEvent.stepStart({ index: 0 }),
  3312. LLMEvent.textStart({ id: "partial" }),
  3313. LLMEvent.textDelta({ id: "partial", text: "Partial" }),
  3314. LLMEvent.stepFinish({
  3315. index: 0,
  3316. reason: "content-filter",
  3317. usage: { nonCachedInputTokens: 8, outputTokens: 3, reasoningTokens: 1 },
  3318. }),
  3319. LLMEvent.finish({ reason: "content-filter" }),
  3320. ]
  3321. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider blocked the response")
  3322. expect(yield* session.context(sessionID)).toMatchObject([
  3323. { type: "user" },
  3324. {
  3325. type: "assistant",
  3326. finish: "error",
  3327. error: { type: "provider.content-filter" },
  3328. cost: 0,
  3329. tokens: { input: 8, output: 2, reasoning: 1, cache: { read: 0, write: 0 } },
  3330. content: [{ type: "text", text: "Partial" }],
  3331. },
  3332. ])
  3333. expect(yield* session.get(sessionID)).toMatchObject({
  3334. cost: 0,
  3335. tokens: { input: 8, output: 2, reasoning: 1, cache: { read: 0, write: 0 } },
  3336. })
  3337. expect(yield* recordedEventTypes(sessionID)).not.toContain("session.step.ended.1")
  3338. }),
  3339. )
  3340. it.effect("settles a local tool before one content-filter step failure", () =>
  3341. Effect.gen(function* () {
  3342. const session = yield* setup
  3343. yield* admit(session, "Tool before blocked response")
  3344. toolExecutionGate = yield* Deferred.make<void>()
  3345. toolExecutionsStarted = yield* Deferred.make<void>()
  3346. toolExecutionsReady = 1
  3347. response = [
  3348. LLMEvent.stepStart({ index: 0 }),
  3349. LLMEvent.toolCall({ id: "call-before-content-filter", name: "echo", input: { text: "settled" } }),
  3350. LLMEvent.stepFinish({ index: 0, reason: "content-filter" }),
  3351. LLMEvent.finish({ reason: "content-filter" }),
  3352. ]
  3353. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3354. yield* Deferred.await(toolExecutionsStarted)
  3355. yield* Deferred.succeed(toolExecutionGate, undefined)
  3356. expect((yield* Fiber.join(run).pipe(Effect.flip)).message).toBe("Provider blocked the response")
  3357. toolExecutionGate = undefined
  3358. toolExecutionsStarted = undefined
  3359. const assistant = requireAssistant(yield* session.context(sessionID))
  3360. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3361. expect(events.map((event) => event.type)).toEqual([
  3362. "session.step.started.1",
  3363. "session.tool.called.1",
  3364. "session.tool.success.1",
  3365. "session.step.failed.1",
  3366. ])
  3367. expect(
  3368. events.filter((event) => event.type.startsWith("session.step.") && event.type !== "session.step.started.1"),
  3369. ).toHaveLength(1)
  3370. }),
  3371. )
  3372. it.effect("does not recover context overflow after durable assistant output", () =>
  3373. Effect.gen(function* () {
  3374. const session = yield* setup
  3375. yield* admit(session, "Fail after output")
  3376. response = [
  3377. LLMEvent.stepStart({ index: 0 }),
  3378. LLMEvent.textStart({ id: "text-partial" }),
  3379. LLMEvent.textDelta({ id: "text-partial", text: "Partial" }),
  3380. LLMEvent.textEnd({ id: "text-partial" }),
  3381. LLMEvent.providerError({ message: "prompt too long", classification: "context-overflow" }),
  3382. ]
  3383. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("prompt too long")
  3384. expect(requests).toHaveLength(1)
  3385. expect(yield* session.context(sessionID)).toMatchObject([
  3386. { type: "user", text: "Fail after output" },
  3387. {
  3388. type: "assistant",
  3389. finish: "error",
  3390. error: { message: "prompt too long" },
  3391. content: [{ type: "text", text: "Partial" }],
  3392. },
  3393. ])
  3394. }),
  3395. )
  3396. it.effect("projects raw provider stream failures as terminal assistant step failures", () =>
  3397. Effect.gen(function* () {
  3398. const session = yield* setup
  3399. yield* admit(session, "Fail raw stream durably")
  3400. const failure = invalidRequest()
  3401. responseStream = Stream.fail(failure)
  3402. expect(yield* session.resume(sessionID).pipe(Effect.flip)).toBe(failure)
  3403. yield* replaySessionProjection(sessionID)
  3404. expect(yield* session.context(sessionID)).toMatchObject([
  3405. { type: "user", text: "Fail raw stream durably" },
  3406. { type: "assistant", finish: "error", error: { type: "provider.invalid-request", message: "Invalid request" } },
  3407. ])
  3408. }),
  3409. )
  3410. it.effect("retries eligible pre-output failures after exponential backoff", () =>
  3411. Effect.gen(function* () {
  3412. const session = yield* setup
  3413. yield* admit(session, "Retry transport")
  3414. responseStream = Stream.fail(providerUnavailable())
  3415. response = reply.text("Recovered", "retry-success")
  3416. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3417. while (requests.length < 1) yield* Effect.yieldNow
  3418. yield* TestClock.adjust("1999 millis")
  3419. expect(requests).toHaveLength(1)
  3420. yield* TestClock.adjust("1 millis")
  3421. yield* Fiber.join(run)
  3422. expect(requests).toHaveLength(2)
  3423. const eventTypes = yield* recordedEventTypes(sessionID)
  3424. expect(eventTypes).toContain("session.retry.scheduled.1")
  3425. expect(eventTypes.filter((type) => type === "session.step.started.1")).toHaveLength(2)
  3426. expect(yield* session.context(sessionID)).toMatchObject([
  3427. { type: "user" },
  3428. { type: "assistant", finish: "stop", content: [{ type: "text", text: "Recovered" }] },
  3429. ])
  3430. yield* replaySessionProjection(sessionID)
  3431. expect((yield* session.context(sessionID)).filter((message) => message.type === "assistant")).toHaveLength(1)
  3432. }),
  3433. )
  3434. it.effect("uses a larger provider retry-after delay", () =>
  3435. Effect.gen(function* () {
  3436. const session = yield* setup
  3437. yield* admit(session, "Retry rate limit")
  3438. responseStream = Stream.fail(rateLimited(5_000))
  3439. response = reply.text("Recovered", "retry-after-success")
  3440. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3441. while (requests.length < 1) yield* Effect.yieldNow
  3442. yield* TestClock.adjust("4999 millis")
  3443. expect(requests).toHaveLength(1)
  3444. yield* TestClock.adjust("1 millis")
  3445. yield* Fiber.join(run)
  3446. expect(requests).toHaveLength(2)
  3447. }),
  3448. )
  3449. it.effect("stops after five total retry attempts", () =>
  3450. Effect.gen(function* () {
  3451. const session = yield* setup
  3452. yield* admit(session, "Exhaust retries")
  3453. streamFailure = providerUnavailable()
  3454. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3455. while (requests.length < 1) yield* Effect.yieldNow
  3456. for (const [index, delay] of [2_000, 4_000, 8_000, 16_000].entries()) {
  3457. yield* TestClock.adjust(delay)
  3458. while (requests.length < index + 2) yield* Effect.yieldNow
  3459. }
  3460. expect(yield* Fiber.join(run).pipe(Effect.flip)).toBe(streamFailure)
  3461. expect(requests).toHaveLength(5)
  3462. const database = (yield* Database.Service).db
  3463. const retries = yield* database
  3464. .select({ data: EventTable.data })
  3465. .from(EventTable)
  3466. .where(eq(EventTable.type, "session.retry.scheduled.1"))
  3467. .orderBy(asc(EventTable.seq))
  3468. .all()
  3469. .pipe(Effect.orDie)
  3470. expect(retries.map((event) => event.data)).toMatchObject([
  3471. { attempt: 2, at: 2_000 },
  3472. { attempt: 3, at: 6_000 },
  3473. { attempt: 4, at: 14_000 },
  3474. { attempt: 5, at: 30_000 },
  3475. ])
  3476. expect((yield* recordedEventTypes(sessionID)).filter((type) => type === "session.step.started.1")).toHaveLength(5)
  3477. expect((yield* session.context(sessionID)).filter((message) => message.type === "assistant")).toHaveLength(1)
  3478. }),
  3479. )
  3480. it.effect("counts retry attempts against the agent step allowance", () =>
  3481. Effect.gen(function* () {
  3482. const session = yield* setup
  3483. const agents = yield* AgentV2.Service
  3484. yield* agents.transform((editor) =>
  3485. editor.update(AgentV2.ID.make("build"), (agent) => {
  3486. agent.steps = 2
  3487. }),
  3488. )
  3489. yield* admit(session, "Bound retries by steps")
  3490. const failure = providerUnavailable()
  3491. responseStream = Stream.fail(failure)
  3492. streamFailure = failure
  3493. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3494. while (requests.length < 1) yield* Effect.yieldNow
  3495. yield* TestClock.adjust("2 seconds")
  3496. expect(yield* Fiber.join(run).pipe(Effect.flip)).toBe(failure)
  3497. expect(requests).toHaveLength(2)
  3498. const eventTypes = yield* recordedEventTypes(sessionID)
  3499. expect(eventTypes.filter((type) => type === "session.step.started.1")).toHaveLength(2)
  3500. expect(eventTypes.filter((type) => type === "session.retry.scheduled.1")).toHaveLength(1)
  3501. expect((yield* session.context(sessionID)).filter((message) => message.type === "assistant")).toHaveLength(1)
  3502. }),
  3503. )
  3504. it.effect("does not retry non-eligible provider failures", () =>
  3505. Effect.gen(function* () {
  3506. const session = yield* setup
  3507. yield* admit(session, "Do not retry")
  3508. const failure = invalidRequest()
  3509. streamFailure = failure
  3510. expect(yield* session.resume(sessionID).pipe(Effect.flip)).toBe(failure)
  3511. expect(requests).toHaveLength(1)
  3512. expect(yield* recordedEventTypes(sessionID)).not.toContain("session.retry.scheduled.1")
  3513. }),
  3514. )
  3515. it.effect("does not continue automatically after a provider error follows a local tool call", () =>
  3516. Effect.gen(function* () {
  3517. const session = yield* setup
  3518. yield* admit(session, "Do not continue failed provider")
  3519. toolExecutionGate = yield* Deferred.make<void>()
  3520. toolExecutionsStarted = yield* Deferred.make<void>()
  3521. toolExecutionsReady = 1
  3522. response = [
  3523. LLMEvent.stepStart({ index: 0 }),
  3524. LLMEvent.toolCall({ id: "call-before-provider-error", name: "echo", input: { text: "settled" } }),
  3525. LLMEvent.providerError({ message: "Provider unavailable" }),
  3526. ]
  3527. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3528. yield* Deferred.await(toolExecutionsStarted)
  3529. yield* Deferred.succeed(toolExecutionGate, undefined)
  3530. expect((yield* Fiber.join(run).pipe(Effect.flip)).message).toBe("Provider unavailable")
  3531. toolExecutionGate = undefined
  3532. toolExecutionsStarted = undefined
  3533. expect(requests).toHaveLength(1)
  3534. expect(executions).toEqual(["settled"])
  3535. const context = yield* session.context(sessionID)
  3536. const assistant = requireAssistant(context)
  3537. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  3538. "session.step.started.1",
  3539. "session.tool.called.1",
  3540. "session.tool.success.1",
  3541. "session.step.failed.1",
  3542. ])
  3543. }),
  3544. )
  3545. it.effect("durably fails a hosted tool when its provider errors before returning a result", () =>
  3546. Effect.gen(function* () {
  3547. const session = yield* setup
  3548. yield* admit(session, "Fail hosted tool durably")
  3549. response = [
  3550. LLMEvent.stepStart({ index: 0 }),
  3551. hostedCall("call-hosted-provider-error", "effect"),
  3552. LLMEvent.providerError({ message: "Provider unavailable" }),
  3553. ]
  3554. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider unavailable")
  3555. expect(requests).toHaveLength(1)
  3556. const context = yield* session.context(sessionID)
  3557. expect(context).toMatchObject([
  3558. { type: "user", text: "Fail hosted tool durably" },
  3559. {
  3560. type: "assistant",
  3561. content: [{ type: "tool", id: "call-hosted-provider-error", state: { status: "error" } }],
  3562. },
  3563. ])
  3564. const assistant = requireAssistant(context)
  3565. expect((yield* recordedStepSettlementEvents(sessionID, assistant.id)).map((event) => event.type)).toEqual([
  3566. "session.step.started.1",
  3567. "session.tool.called.1",
  3568. "session.tool.failed.1",
  3569. "session.step.failed.1",
  3570. ])
  3571. }),
  3572. )
  3573. it.effect("preserves a tool defect before provider failure settlement", () =>
  3574. Effect.gen(function* () {
  3575. const session = yield* setup
  3576. yield* admit(session, "Defect while provider fails")
  3577. response = [
  3578. LLMEvent.stepStart({ index: 0 }),
  3579. LLMEvent.toolCall({ id: "call-defect-provider-error", name: "defect", input: {} }),
  3580. LLMEvent.providerError({ message: "Provider unavailable" }),
  3581. ]
  3582. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider unavailable")
  3583. const context = yield* session.context(sessionID)
  3584. const assistant = requireAssistant(context)
  3585. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3586. expect(events.map((event) => event.type)).toEqual([
  3587. "session.step.started.1",
  3588. "session.tool.called.1",
  3589. "session.tool.failed.1",
  3590. "session.step.failed.1",
  3591. ])
  3592. expect(events[2]?.data.error).toMatchObject({ type: "unknown", message: "unexpected tool defect" })
  3593. }),
  3594. )
  3595. it.effect("durably fails a hosted tool left unresolved at normal provider EOF", () =>
  3596. Effect.gen(function* () {
  3597. const session = yield* setup
  3598. yield* admit(session, "Fail hosted tool at EOF")
  3599. response = [LLMEvent.stepStart({ index: 0 }), hostedCall("call-hosted-eof", "effect")]
  3600. expect((yield* session.resume(sessionID).pipe(Effect.flip)).message).toBe("Provider did not return a tool result")
  3601. const assistant = requireAssistant(yield* session.context(sessionID))
  3602. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3603. expect(events.map((event) => event.type)).toEqual([
  3604. "session.step.started.1",
  3605. "session.tool.called.1",
  3606. "session.tool.failed.1",
  3607. "session.step.failed.1",
  3608. ])
  3609. expect(
  3610. events.filter((event) => event.type.startsWith("session.step.") && event.type !== "session.step.started.1"),
  3611. ).toHaveLength(1)
  3612. yield* replaySessionProjection(sessionID)
  3613. expect(yield* session.context(sessionID)).toMatchObject([
  3614. { type: "user", text: "Fail hosted tool at EOF" },
  3615. {
  3616. type: "assistant",
  3617. finish: "error",
  3618. error: { type: "tool.result-missing" },
  3619. content: [{ type: "tool", id: "call-hosted-eof", state: { status: "error" } }],
  3620. },
  3621. ])
  3622. }),
  3623. )
  3624. it.effect("fails an unresolved hosted tool before one clean step end", () =>
  3625. Effect.gen(function* () {
  3626. const session = yield* setup
  3627. yield* admit(session, "Settle hosted tool before ending")
  3628. response = [
  3629. LLMEvent.stepStart({ index: 0 }),
  3630. hostedCall("call-hosted-clean-end", "effect"),
  3631. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  3632. LLMEvent.finish({ reason: "stop" }),
  3633. ]
  3634. yield* session.resume(sessionID)
  3635. const assistant = requireAssistant(yield* session.context(sessionID))
  3636. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3637. expect(events.map((event) => event.type)).toEqual([
  3638. "session.step.started.1",
  3639. "session.tool.called.1",
  3640. "session.tool.failed.1",
  3641. "session.step.ended.1",
  3642. ])
  3643. expect(
  3644. events.filter((event) => event.type.startsWith("session.step.") && event.type !== "session.step.started.1"),
  3645. ).toHaveLength(1)
  3646. }),
  3647. )
  3648. it.effect("settles unresolved local and hosted tools before one raw provider failure", () =>
  3649. Effect.gen(function* () {
  3650. const session = yield* setup
  3651. yield* admit(session, "Fail unresolved tools")
  3652. const failure = invalidRequest()
  3653. const providerFailed = yield* Deferred.make<void>()
  3654. toolExecutionGate = yield* Deferred.make<void>()
  3655. responseStream = Stream.concat(
  3656. Stream.fromIterable([
  3657. LLMEvent.stepStart({ index: 0 }),
  3658. LLMEvent.toolCall({ id: "call-local-raw-failure", name: "defect", input: {} }),
  3659. hostedCall("call-hosted-raw-failure-pair", "effect"),
  3660. ]),
  3661. Stream.fromEffect(Deferred.succeed(providerFailed, undefined)).pipe(Stream.flatMap(() => Stream.fail(failure))),
  3662. )
  3663. const run = yield* session.resume(sessionID).pipe(Effect.forkChild)
  3664. yield* Deferred.await(providerFailed)
  3665. yield* Deferred.succeed(toolExecutionGate, undefined)
  3666. expect(yield* Fiber.join(run).pipe(Effect.flip)).toBe(failure)
  3667. toolExecutionGate = undefined
  3668. const assistant = requireAssistant(yield* session.context(sessionID))
  3669. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3670. expect(events.map((event) => ({ type: event.type, callID: event.data.callID }))).toEqual([
  3671. { type: "session.step.started.1", callID: undefined },
  3672. { type: "session.tool.called.1", callID: "call-local-raw-failure" },
  3673. { type: "session.tool.called.1", callID: "call-hosted-raw-failure-pair" },
  3674. { type: "session.tool.failed.1", callID: "call-local-raw-failure" },
  3675. { type: "session.tool.failed.1", callID: "call-hosted-raw-failure-pair" },
  3676. { type: "session.step.failed.1", callID: undefined },
  3677. ])
  3678. expect(
  3679. events.filter((event) => event.type.startsWith("session.step.") && event.type !== "session.step.started.1"),
  3680. ).toHaveLength(1)
  3681. }),
  3682. )
  3683. it.effect("durably fails a hosted tool left unresolved by a raw provider stream failure", () =>
  3684. Effect.gen(function* () {
  3685. const session = yield* setup
  3686. yield* admit(session, "Fail hosted tool on raw failure")
  3687. const failure = providerUnavailable()
  3688. responseStream = Stream.concat(
  3689. Stream.fromIterable([LLMEvent.stepStart({ index: 0 }), hostedCall("call-hosted-raw-failure", "effect")]),
  3690. Stream.fail(failure),
  3691. )
  3692. expect(yield* session.resume(sessionID).pipe(Effect.flip)).toBe(failure)
  3693. expect(requests).toHaveLength(1)
  3694. const assistant = requireAssistant(yield* session.context(sessionID))
  3695. const events = yield* recordedStepSettlementEvents(sessionID, assistant.id)
  3696. expect(events.map((event) => event.type)).toEqual([
  3697. "session.step.started.1",
  3698. "session.tool.called.1",
  3699. "session.tool.failed.1",
  3700. "session.step.failed.1",
  3701. ])
  3702. expect(
  3703. events.filter((event) => event.type.startsWith("session.step.") && event.type !== "session.step.started.1"),
  3704. ).toHaveLength(1)
  3705. yield* replaySessionProjection(sessionID)
  3706. expect(yield* session.context(sessionID)).toMatchObject([
  3707. { type: "user", text: "Fail hosted tool on raw failure" },
  3708. {
  3709. type: "assistant",
  3710. finish: "error",
  3711. error: { type: "provider.transport", message: "Provider unavailable" },
  3712. content: [{ type: "tool", id: "call-hosted-raw-failure", state: { status: "error" } }],
  3713. },
  3714. ])
  3715. }),
  3716. )
  3717. it.effect("rejects a second text start before the open fragment ends", () =>
  3718. Effect.gen(function* () {
  3719. const session = yield* setup
  3720. yield* admit(session, "Two blocks")
  3721. response = [
  3722. LLMEvent.stepStart({ index: 0 }),
  3723. LLMEvent.textStart({ id: "text-1" }),
  3724. LLMEvent.textStart({ id: "text-2" }),
  3725. ]
  3726. const defect = yield* session.resume(sessionID).pipe(Effect.catchDefect(Effect.succeed))
  3727. expect(defect).toBeInstanceOf(Error)
  3728. if (!(defect instanceof Error)) return
  3729. expect(defect.message).toBe("text start before end: text-2")
  3730. }),
  3731. )
  3732. it.effect("projects sequential text fragments as separate content parts", () =>
  3733. Effect.gen(function* () {
  3734. const session = yield* setup
  3735. yield* admit(session, "Two blocks")
  3736. response = [
  3737. LLMEvent.stepStart({ index: 0 }),
  3738. LLMEvent.textStart({ id: "text-1" }),
  3739. LLMEvent.textDelta({ id: "text-1", text: "First" }),
  3740. LLMEvent.textEnd({ id: "text-1" }),
  3741. LLMEvent.textStart({ id: "text-2" }),
  3742. LLMEvent.textDelta({ id: "text-2", text: "Second" }),
  3743. LLMEvent.textEnd({ id: "text-2" }),
  3744. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  3745. LLMEvent.finish({ reason: "stop" }),
  3746. ]
  3747. yield* session.resume(sessionID)
  3748. expect(yield* session.context(sessionID)).toMatchObject([
  3749. { type: "user", text: "Two blocks" },
  3750. {
  3751. type: "assistant",
  3752. content: [
  3753. { type: "text", text: "First" },
  3754. { type: "text", text: "Second" },
  3755. ],
  3756. },
  3757. ])
  3758. }),
  3759. )
  3760. for (const kind of fragmentKinds) {
  3761. it.effect(`broadcasts provider ${kind} deltas without storing projection rewrites`, () =>
  3762. verifyEphemeralDeltas(kind),
  3763. )
  3764. it.effect(`durably closes partial ${kind} when the provider stream fails`, () => verifyPartialFlushOnFailure(kind))
  3765. it.effect(`durably closes partial ${kind} when the provider stream is interrupted`, () =>
  3766. verifyPartialFlushOnInterruption(kind),
  3767. )
  3768. }
  3769. it.effect("rejects duplicate streamed text starts", () =>
  3770. Effect.gen(function* () {
  3771. const session = yield* setup
  3772. response = [LLMEvent.textStart({ id: "text-1" }), LLMEvent.textStart({ id: "text-1" })]
  3773. const defect = yield* session.resume(sessionID).pipe(Effect.catchDefect(Effect.succeed))
  3774. expect(defect).toBeInstanceOf(Error)
  3775. if (!(defect instanceof Error)) return
  3776. expect(defect.message).toBe("Duplicate text start: text-1")
  3777. }),
  3778. )
  3779. it.effect("transitions streamed raw tool input to parsed called input", () =>
  3780. Effect.gen(function* () {
  3781. const session = yield* setup
  3782. yield* admit(session, "Call provider tool")
  3783. response = [
  3784. LLMEvent.stepStart({ index: 0 }),
  3785. LLMEvent.toolInputStart({ id: "call-parsed", name: "web_search" }),
  3786. LLMEvent.toolInputDelta({ id: "call-parsed", name: "web_search", text: '{"query":"hello"}' }),
  3787. LLMEvent.toolInputEnd({ id: "call-parsed", name: "web_search" }),
  3788. hostedCall("call-parsed", "hello"),
  3789. LLMEvent.stepFinish({ index: 0, reason: "stop" }),
  3790. LLMEvent.finish({ reason: "stop" }),
  3791. ]
  3792. yield* session.resume(sessionID)
  3793. expect(yield* session.context(sessionID)).toMatchObject([
  3794. { type: "user", text: "Call provider tool" },
  3795. {
  3796. type: "assistant",
  3797. content: [{ type: "tool", id: "call-parsed", state: { status: "error", input: { query: "hello" } } }],
  3798. },
  3799. ])
  3800. }),
  3801. )
  3802. it.effect("rejects malformed streamed tool input ordering", () =>
  3803. Effect.gen(function* () {
  3804. const session = yield* setup
  3805. response = [LLMEvent.toolInputDelta({ id: "call-1", name: "read", text: "{}" })]
  3806. const defect = yield* session.resume(sessionID).pipe(Effect.catchDefect(Effect.succeed))
  3807. expect(defect).toBeInstanceOf(Error)
  3808. if (!(defect instanceof Error)) return
  3809. expect(defect.message).toBe("Tool input delta before start: call-1")
  3810. }),
  3811. )
  3812. })