$ grep -r "ai-safety" ./posts/
# ai-safety
Все
ai
claude-code
llm
agents
open-source
anthropic
developer-tools
productivity
tips
claude
mcp
openai
coding
security
cursor
api
tools
gemini
google
codex
cli
automation
ai-agents
workflow
qwen
devtools
testing
pricing
voice
models
ide
comparison
coding-tools
ai-tools
benchmarks
skills
tokens
multimodal
openrouter
ai-models
plugins
gpt
ai-coding
xai
grok
cybersecurity
leak
deepseek
alibaba
tdd
benchmark
research
coding-agent
playwright
orchestration
codex-cli
multi-agent
context-window
coding-agents
memory
python
chatgpt
stealth-models
protocol
google-io-2026
gpt-5-6
moe
git
openclaw
ralph-loop
autonomous-coding
github
copilot
ios
swift
xcode
computer-use
gpt-5.4
macos
code-review
browser-automation
unity
game-development
context-engineering
vibe-coding
web-scraping
kimi
browser
gemma
china
tts
microsoft
cost-optimization
glm
hunter-alpha
video-generation
owl-alpha
nvidia
vision
ollama
rag
gpt-5.6
local
local-llm
ai-safety
fable
meta
prompt-engineering
safety
prompt-injection
open-weights
coding-assistant
deep-research
terminal
qa
php
laravel
assistant
worktrees
docker
parallel-development
oauth
websocket
context-management
mobile
perplexity
multi-model
image-generation
remotion
video
shorts
instagram
tiktok
permissions
future
code-intelligence
knowledge-graph
future-of-programming
opinion
hooks
xctest
commands
local-ai
liquid-ai
privacy
fast-mode
copilot-cli
linux
windows
machine-learning
cron
scheduled-tasks
effort
settings
godot
unreal-engine
search-api
tavily
exa
agent-teams
opus-4.6
expo
cowork
remote-control
plugin
google-colab
responsive-design
frontend
telegram
discord
channels
astral
superapp
licensing
documentation
prompts
figma
design
web-development
demo
gamedev
gemini-cli
speech
scraping
self-improvement
ultraplan
debugging
function-calling
free-tools
elevenlabs
infrastructure
configuration
skill
dotnet
nous-research
gpt-6
llama
healer-alpha
elephant-alpha
gpt-5-5
tmux
stealth-launch
fal
elixir
linear
rust
tencent
voice-cloning
reasoning
nemotron
mythos
policy
dense-model
game-dev
open-beta
sonnet
gpt-55
spacex
managed-agents
realtime
subq
subquadratic
long-context
transformers
finance
edge-ai
vector-search
notion
typescript
workers
malware
chrome
leaks
veo
lmarena
fingerprinting
api-pricing
onboarding
opus-4-8
robotics
world-models
physical-ai
minimax
free-models
ocr
baidu
document-ai
release-tracker
gemini-35-pro
ml
amazon
data-labeling
amd
hardware
llama-cpp
code-quality
interpretability
apple
lawsuit
curl
writing
pentesting
career
wordpress
vulnerability
evaluation
context7
redis
devops
rce
migration
alignment
kubernetes
npm
supply-chain
cve
sqlite
dataviz
inference
vllm
performance
enterprise
search
embeddings
>
·
7 мин
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.
ai
llm
openai
security
>
·
4 мин
Anthropic научилась читать мысли Claude: J-lens видит слово fraud в голове модели-саботажника до первого токена
Anthropic нашла в Claude аналог рабочей памяти — J-space — и научилась его читать. Модель-саботажник выдаёт себя словами fake и fraud до первого токена, а агентские evals она распознаёт как постановку. Код и демо открыты.
claude
anthropic
interpretability
ai-safety